先听分段声音,再听同一句的成片
选择一句含有人名、因果或否定的信息句,例如“他没有拿走钥匙”。不看字幕听一遍,再带字幕核对;如果只能靠字幕猜出“没有”,就不能用“时长已对齐”作为采用理由。
| 听到的问题 | 先检查什么 |
|---|---|
| 原始分段也急,词与词挤在一起 | 原稿信息密度、朗读方式与当前引擎支持的控制。 |
| 分段清楚,整条成片都急 | 合成时有没有再次整体提速。 |
| 只有某句在成片里急 | 该句是否为了放进较短画面窗口而局部提速。 |
| 声音清楚,但画面已切到下个动作 | 重新安排窗口;不是继续加速的充分理由。 |
不要只在编辑器里降预览播放速度。那能帮助定位,导出的成片仍可能使用原来的声音处理。保留原始分段,和新的候选成片比较同一句。
把生成语速和合成速度分别说明
原生方法把生成时的语速请求、整体变速和段内适配分开记录。旧的普通合成路径有整体速度默认值;已明确采用的配音则以独立确认的速度策略为准,环境里的默认速度不能覆盖它。
给执行者的要求可以是:“先保留这份已听过的声音;合成不再整体提速,也不为塞进窗口额外加速。若完整声音放不下,先告诉我需要调整哪段画面,不裁尾,不改已定文字。”明确采用的策略可用global_atempo: 1.0和bounded_segment_fit: false表达这两项选择;前者保持输入声音在合成时的速度,不能把已经急促的输入自动恢复成自然朗读。
如果原始声音就太快,再改生成环节。仓库按引擎分别处理:有的采用自身默认控制,有的把语速请求转成朗读提示。不要把“减速10%”承诺成所有引擎都精确执行的旋钮。先生成同一句候选、实际听过,再决定采用哪份。也不要靠大量感叹号或省略号碰运气,它们还可能改变语气和停顿。
完整示例:让“没有拿走”听得清楚
以下是纸面教学案例,没有在本文生成或测听音频。原创画面:林澈从柜台移开手,钥匙仍放在白盘里;旁白定稿为“他没有拿走钥匙,只把借用时间改到明早。”本例假设作者试听原始分段认为清楚,但成片里的“没有”太急,容易听成拿走。
排查记录显示这段输入长6秒,画面窗口有7秒(含原先设计的1秒段末留白),合成又做了整体1.15倍提速。仅按理想比例计算,6 ÷ 1.15约为5.22秒;这是解释速度变化的算式,不是实际导出测量,也不能由数字证明哪个词一定听不清。本例未记录局部再提速,不凭空加一个原因。
作者选择保留原始声音,把该段合成速度设为1.0,关闭额外段内适配,重新做候选。在纸面安排中,画面窗口保留7秒,让完整6秒声音后仍有原先设计的1秒留白;字幕按实际采用声音重新定位,不沿用5.22秒的估算时间。画面仍是手移开、钥匙未动,不为赶旁白新增取走动作。
如果实际素材只剩5秒窗口,就不能同时声称完整6秒声音保持原速又已经放下。先由作者决定能否延长或重排画面;如果画面不可改、文字可改,再提出保留“没有拿走”和次日借用安排的压缩候选,确认后重新配音。文字也不可改时,原生明确采用策略会阻止超窗,不暗中加速或切词。
最后要听新成片,确认否定句、人名和句尾仍清楚,声音对应钥匙未动的画面,字幕对应这份声音。本文给的是定位和选择步骤,不把纸面安排写成已通过的声音质量结果。
最后采用的是哪份声音,必须再听
只调一个已定位的环节,再比较同一句,避免把声线、文字、语速、画面同时换掉后无法判断原因。保留定稿文字和所选声音对应关系;速度改变会影响字幕和原声重叠,核对句尾有没有压住必须听见的台词或动作声。
原生记录能说明哪些输入和速度策略进入合成,不能代替直接试听,也不能证明引擎身份、声线自然或已经获准发布。低于某个速度上限同样不保证易懂:名字密集、信息跳跃或句子太长,可能需要作者批准文字调整。
若你的问题是同一旁白超出画面,继续看配音超时处理;若提速后声调变怪,看速度与音高检查。本页重点是声音已经急到影响理解时,如何定位并采用可听清的版本。
常见问题
调成1倍就一定自然吗?
不保证。它只能避免合成时额外整体提速;原始声音已经急,仍需调整朗读、重新生成并试听。
慢下来放不进画面怎么办?
先确认画面能否调整;若文字可改,批准压缩后重新配音。画面和文字都锁定时,不暗中提速或截断完整句子。
用 skill 来做
合成阶段将分段声音与速度策略落实到时间线;先定位生成、整体与局部三处,明确选择声音后再核成片。
查看具体方法: 生成环节按引擎区分语速控制 · 整体速度与累计提速预算 · 整体提速与段内适配分别处理 · 明确采用的速度策略与试听边界