先分清翻译配音与中文解说
video-recap 的英译中模式把原说话者的内容译成中文,再逐句生成语音放回原时间线。它不是压低英文原声、叠加一份重新讲故事的解说稿。要总结、评述或删掉重复,应选择解说任务,而非暗中改动翻译。
开始前检查说话者人数,以及原轨里有没有需要保留的音乐和环境声。本文引用的固定版本只有单说话者整轨替换,不提供背景音乐分离;原素材包含重要现场声音时,需要另定声音方案,不能假定换人声后这些声音仍在。
确认英文转写也很重要。人名、数量、否定和操作顺序听错,流畅译文也会变成错误内容。先回听可疑词,再进入译文,不让后面的合成掩盖上游错误。
逐句保留含义、重复和时间窗
以下是为本文设计的虚构工具演示,不是已生成的配音结果。
| 原声时间窗 | 判断与处理 |
|---|---|
| 0–3 秒 | 英文内容: Keep the lid open until the light goes out. 中文译文: 灯熄灭前,别合上盖子。 检查: 保留时间条件与否定关系 |
| 3–5 秒 | 英文内容: Not yet. 中文译文: 还不行。 检查: 不能因为重复提醒而删掉 |
| 5–8 秒 | 英文内容: Now close it, then press the blue button. 中文译文: 现在合盖,再按蓝色按钮。 检查: 保留先后与颜色 |
每句沿用原时间窗,相邻句不重叠。中文可以调整语序,让意思自然,但不能把“灯灭前别合盖”缩成“合盖”,也不能把下一句的指令提前说完。
可复制记录项:原文、已核对译文、开始、结束、时长、疑点、实听结果。没有试听的格子写“待检查”,不要预填“已同步”。
译文太长,先保含义,再检查实际发声
该版本以约每秒五个中文字作为译文长度参考,但数字、英文名称、停顿和音色都会影响实际时长,不能当所有句子的硬上限。先用自然中文去掉翻译造成的冗余,不删原文必要信息,也不擅自合并句子。
例如“在指示灯仍然保持点亮状态的这段时间里面,不要将盖子进行关闭”可改成“灯亮着时,别合盖”。这是语句简洁化;把完整提醒删掉则改变内容。
实际实现逐句锚定start,空间按本句end与下一句start的较早者计算,并设0.4秒下限;不是只在越过下一句时才处理。短于空间且在容差内的WAV保持节奏,超出时局部加速。
重要边界:引用版本的压缩上限为2倍。仍超出时,会对加速后的音频裁到窗口并淡出;所以输出时长符合窗口,可能仍丢了语尾。不要把“已导出”或拟合时长当整句已保留。
纸面例:原WAV长5秒、可用空间2秒,所需压缩2.5倍超过上限;先2倍得到约2.5秒,再裁到2秒,最后0.5秒可能含必要内容。此例未合成或听审,实际丢哪些字必须回听。
保留完整含义仍说不完时,回修具体译句或重新确定时间方案,再检查raw与fitted两份声音。普通解说旁白的批准稿保护与dub不是同一路径,不能假定加一个保护要求就让dub自动阻断所有裁尾。
验收回到原句、动作和接点
逐句核对三个问题:有没有译错或漏掉条件;中文实际说完了吗;画面中的操作是否仍在正确时刻发生。随后连播相邻句,听有没有重叠、突兀空白或语气突然变样。
若英文转写有误,先修原文和译文;若只是某句超窗,定位该句,不整片统一加速;若原背景音乐消失,回查整轨替换的模式选择,不把问题误判成音量设置。
通过文件校验与完成导出不等于翻译准确或听感自然。保留已核对的逐句表和实际试听记录,方便只修问题位置。这篇处理的是跨语言忠实翻译;已有中文文案超出画面时间窗,另见配音超时指南。
dub的输入门禁能阻止空行、重叠和越界安排;它在合成前记录文字与时长风险,不能证明生成的发音或裁尾后内容完整。回听每句的条件、否定与最后音节,再核对画面。
常见问题
能把多人英文访谈直接用这个模式配成中文吗?
本文引用版本不支持;它只有单说话者、逐句合成和整轨替换。多人身份分配、多人音色与保留现场音乐需要另选流程,不应按单人教程假设已经解决。
用 skill 来做
请用 video-recap 处理单说话者英文视频的中文翻译配音。先核对原转写,逐句保留含义与原时间窗,列出超窗和疑点;开始前说明整轨替换对原音乐与环境声的影响。
查看具体方法: 英译中逐句配音与版本范围 · 逐句时间适配、压缩上限与裁尾 · 普通旁白保护与dub的边界