先问:是旁白停了,还是整片真的无声
原对白、操作声、环境声和沉默可以承担一段内容。听见旁白停下来,不代表应该补满;画面上一个决定尚未完成,提前讲下一步也会破坏理解。
| 空白来自哪里 | 怎样定位 |
|---|---|
| 分段WAV内部 | 单听开头、句中与尾部;文件时长不等于最后一个音节的位置 |
| 输入的时间窗口 | 看上一段end与下一段start,确认作者是否有意留出原声 |
| 合成设置与实际落点 | 看实际place起止;入场延迟、上一句停顿和收紧策略可能参与 |
| 无旁白但仍有场内声音 | 连同画面判断其职责,不按旁白密度一律删除 |
先找哪一种问题,再选合成、时间线或剪辑修订。别为了“流畅”整片加速或把所有停顿归零。
为什么改段尾停顿可能没有用
所引旁白合成先用段长减去 pause_after_ms 来估计语音空间,并有最小空间限制;这不是已经听到的停顿测量。下游另按实际音频、入场延迟和前段结束放置。
关闭段内收紧或进入新段落时,下一句仍尊重作者起点与入场条件;段内收紧则比较前句实际收尾、短间隔与允许提前的下限,不单靠上一句的pause字段。作者留出较长间隙时会视为新段,不自动把所有话挤到前面。
因此,要核对当前实际使用的策略与放置结果,不只修改一个数字。若声音已经采用为完整混音,重新收紧会改变它;按本轮授权选择修订,不在“保留已定声音”的任务里偷偷重放置。
纸面演算:四点二秒空白从哪里来
以下假设关闭收紧、没有入场延迟且不变速,没有生成或听审媒体。A窗口10–13秒,WAV放在10–12.4秒;假设最后音节在11.8秒,后面0.6秒为WAV尾部静音。B窗口16–19秒,放置与开口都从16秒开始。A的段尾pause为0.3秒。
| 区间 | 意义 |
|---|---|
| 11.8–12.4 | A的WAV尾部静音,0.6秒 |
| 12.4–13 | A窗口尚未用完,0.6秒 |
| 13–16 | 两个作者窗口之间的留白,3秒 |
| 11.8–16 | 旁白听觉间隙合计4.2秒;是否整片静音另听其他轨 |
前段文件结束12.4秒,加0.3秒仍只到12.7,早于B原定16秒。将pause减到0并不能单独把B移到13秒;假定的三秒作者留白仍在。
若13–16秒保留必要原对白,就保持它。若实际素材只是重复工具展示、确实没有需要等待的信息,可以提出删这三秒画面,同时重算B及后续落点与字幕;不是只让B提前说、画面却仍在旧时刻。先确认源素材与表达要求,再制作候选。
修后听三处,再连画面看
单听问题段,确认没有为了去静音截掉吸气、语尾或轻声字;连听前后句,确认间隔和音色自然;看当前成片,确认下一步信息没有抢在动作或原话之前。
更新实际放置记录和受影响字幕,保留未改内容。还没做候选时只记录拟改方案,做完后再写实际起止;同一组配置也不证明听感一致。
长停顿不一定坏。有意义的等待可以保留,机械空白才需要修;目标是该快的地方连贯,该让观众理解和感受的地方留得住。
常见问题
把pause_after_ms设成0就会没有停顿吗?
不会。WAV内部静音、作者窗口、入场延迟与收紧策略仍可能参与。看实际声音与放置,不只看字段。
能把所有句子提前排紧吗?
先看原声、动作和信息揭示。需要保留的间隙不能被挤掉;重剪画面时也要重算声音与字幕。
用 skill 来做
请 video-recap 只排查下述配音或合成问题。先确认当前采用文件与具体时间,列出能观察的事实、缺失证据和最小修订;保留定稿、未受影响声音与画面。未生成或未听审的部分标待检查,不把元数据当实听通过。
查看具体方法: 分段窗口与段尾停顿契约 · 合成预算与分段记录 · 实际入场与段内收紧 · 声音分工与有意义的停留