先分清超的是哪一个窗口

Video Recap 的配音技能为带起止时间的旁白逐段合成。cut 流程中的旁白时间属于剪后输出,不能把原片秒数直接当配音位置。先检查输入时间、窗口是否重叠,以及是否给必需原对白留了空间。

原创纸面例子:第六段安排在成片 18—22 秒,共四秒;试生成完整语音需要六秒。这里的数字只是示范诊断,不是实测音频。要同时记住原稿、实际读取文本、完整时长与结束位置,不能只看字幕行数。

若窗口标错,先修时间。若窗口正确而文字太多,再讨论压稿、改画面或重新安排,不把所有超时都归成供应商速度慢。

压缩重复解释,保住因果

原稿示例:“因为此前他已经答应保管这把钥匙,所以在发现柜子空了以后,他才终于意识到自己必须马上去找把钥匙交给他的人。”

可改为:“他答应保管钥匙,如今柜子空了,只能去找交钥匙的人。”保留承诺、当前发现与下一目标,删掉重复时间推进与解释腔。是否实际能放进四秒,仍要重新合成试听,不能按字数估算宣布成功。

如果“答应保管”已由保留原对白交代,旁白还可缩为“柜子空了,他去找交钥匙的人”。前提是观众确实能听到那句承诺,不把被剪掉的证据当作已知。

四秒窗口装六秒配音,要检查后面是谁在说话

继续使用18—22秒窗口的纸面例。再假设22—24秒必须保留人物原对白。六秒旁白若仍从18秒开始,会说到24秒,盖住这段原对白;只把文案里的“结束22秒”改成24秒,并没有处理冲突。

选择本例修法与验收
可以改稿删除重复解释形成新稿,再实际合成,确认完整朗读确实能放进18—22;不能按字数宣布已压到四秒
原文与原速必须保留,画面可延长若源素材真有可用的连续画面,可以让当前段多留两秒,完整旁白在18—24;原对白及其画面随后移到24—26,后续累计位置一起更新
原文必须保留,画面不能延长另找足够的输出位置或重新设计段落;没有合适安排就保留待修,不能裁尾或自动覆盖必要原对白

第二行只是本例允许延长时的编辑方案,不是配音工具自动实现的能力。确认多留画面确实存在、没有伪造反应,剪后再测实际时长、字幕与音效;不能把静止画面默认拉长两秒就算自然。若实际语音或渲染时长与假设不同,用实际值重排。

原文保护也不等于必须用完全相同的表演;可以试更合适但可辨的朗读。已采用原速版本时,按该决定重新安排,别再靠下游默认加速掩盖窗口不足。

已定文案用明确保护策略

在引用版本的 video-voiceover 中,默认超窗可能在句界自动缩稿,并记录 spoken_text/truncated。原稿已确定时,显式使用 --preserve-approved-text:保留作者原文证据,放不下时报告失败,而不是悄悄交付缩短版。

失败后按创作选择处理:给完整声音更长窗口、把必要背景放到另一段,或经明确修订形成新稿。若后续采用配音的原速合同,也不能让旧适速缓存偷偷覆盖它。

配音只生成输入稿件的语音,不负责自动选镜头、混音或字幕。修改安排后,重新检查下游放置文件与字幕所用文本,避免声音一版、字幕另一版。

分段元数据中的 fit_status: pending_assembly 表示还待合成放置,audio_duration 是生成语音时长;最终放置起止也需在合成后核对。生成WAV成功不等于六秒声音已经在四秒画面中完整交付。

完整听到最后一个字

逐段听句尾、呼吸与下一段接续,检查是否因加速变得难懂,是否截掉结论,是否压住必须听见的原声。配音完整但放置后被裁尾,同样没有解决问题。

短窗口不够用时,不要为保持形式一致把所有段落一起加速。优先修最重的几段;画面允许停留时可以延长,画面不能延长时修文案或位置。

最后核对整条输出时间线:没有重叠、必需段没有缺失、文字与实际声音一致。自动时长检查帮助定位,听感和叙事完整性仍需要实际试听与看片。

常见问题

字幕能放下,配音为什么放不下?

阅读行数不等于朗读时长。语速、停顿和声线都会影响时间;比较实际完整音频与输出窗口,不能只凭字幕长度判断。

用 skill 来做

请通过 video-recap 检查超时配音,保留我的已定文案,交 video-voiceover 使用批准稿保护策略;先报告原稿、实读文本、完整时长与窗口,再建议修法。

查看具体方法: 逐段配音与已定原稿保护 · 合成放置与不裁尾规则 · 生成时长与待放置元数据

了解 Video Recap Skills在 GitHub 查看 video-voiceover

全部指南