把“机械”描述成能复查的听感

“不够自然”太宽。先记问题段与实际现象:句句同一种重音;每个字幕短句都停一次;疑问句像宣读通知;原分段有起伏,放入成片后却明显急促。不同现象对应不同修法。

信息型讲解本来可以平稳,克制旁白也不必处处惊讶。不要把“全程高兴、每句上扬”当成自然标准。只有文字资料时,本页能提供朗读方案和待听点,不能替你判断声音已经机械或已经改善。

先让旁白形成一个连续思路

源剪辑方法先决定旁白负责补背景、连接因果、解释已有证据还是转场,再写能一口气听懂的思路。字幕可以拆多个阅读片段,不应反过来把一段朗读拆成句句独立合成。

“她来了。她拿起纸。她看了。她停了。”若只是复述已看清的动作,可以删;若这段确需连接信息,把动作与变化连起来。不能为了更有起伏,凭空加“她知道凶手就是他”。朗读稿的准确事实仍来自素材和已定上下文。

必要的安静、原对白与反应也保留,不靠旁白占满所有空档。

先核当前路径吃不吃这个语气设置

所引固定版本中,MiMo路径把可选emotion放进自然语言user指令,准确朗读文本另放assistant内容。emotion不是要求它把“疑虑”二字读出来,也不是声线验证。

同版Fish路径调用没有传入这项emotion;不能因输入JSON写了就声称已生效。自托管IndexTTS固定请求只含voice与text,非空emotion/style或非默认rate/pitch会显式失败。遇到不支持的路径,应删除不适用设置或另行选择制作办法,不伪装它会自动理解。

这些只是本仓库适配器行为,不概括供应商所有产品,也不保证支持路径会按指令演出。

原创改法:定稿不变,试一项克制语气

纸面方案采用名单展开与折回两个画面,末行阅读这一过渡由已定故事事实支持,本版选择旁白连接。准确台词已选为“她把名单展开,看到最后一行,又折了回去。”没有素材证明她已经认出凶手或知道名单真假,不能加这些心理。窗口暂定六秒,实际可放时长待合成后核对。

本例整体旁白方向是克制说明,既有style与此兼容;若全局风格仍要求夸张喊叫,先协调相关设置,不能声称只改了一个字段。先不用“她。把名单。展开。”的字幕式拆法。若采用所引MiMo路径,可以给同一段以下输入;这里没有生成音频:

  • start: 0
  • end: 6
  • narration: 她把名单展开,看到最后一行,又折了回去。
  • emotion: 克制、疑虑;前半说明动作,末句收住,不夸张喊叫

这里的疑虑是作者选择的旁白表达,不新增人物确定性知识。英文解释对应“she unfolds the list, sees its last line, and folds it back”;示范实际朗读稿仍是上面的中文。

比较顺序:保持台词、声线与窗口,比较原候选和这一项语气调整后的候选;实际听重音、停顿、字词完整和末句接续。若当前路径不支持emotion,这份输入不能照搬。若声音超窗,也不能为了完成比较而截断尾字;先按保全文本策略说明稿件、窗口或明确速度预算的选择。参数设计不是试听结论。

原段好听,还要核放进画面以后怎样

重新生成后,先听原段,再正常速度播放成片。原段顺、成片急,就查后续放置与变速;原段每句都断,就查文本和分段。检查“看起来像改善”是否以漏字、换含义或盖住重要原声为代价。

记录准确候选、参数、文本、时间窗与观察。自然度和感染力是试听意见,不写成机器通过;一条短句适合的语气也不能自动成为整片所有段落的模板。

需要修句间等待时看停顿排查,不要把所有呼吸和安静都删到同样短。

常见问题

每句都加情绪标签会更自然吗?

不一定。先按这段内容的声音任务选表达,再看当前路径是否支持,最后实际听。平稳说明与克制停顿本身也可以合适。

字幕拆短,配音也必须一样拆吗?

不用。字幕服务阅读,朗读保留连续思路;拆成多个cue不表示要逐cue重新合成。

用 skill 来做

用 $video-voiceover 检查这段旁白的朗读设计。附定稿、窗口、分段和实际听感,保留事实与准确台词;只指出连贯表达、当前provider支持的语气控制和后期速度问题。若调整文本或窗口需作者选择,单列出来。不声称写了emotion就自然,也不向不支持的路径塞控制字段。

查看具体方法: 连续朗读思路与声音分工 · 语气指令、分段与路径差异 · 不支持控制时显式拒绝

了解 Video Recap Skills在 GitHub 查看 video-voiceover

全部指南