先判断声音还适不适合新画面
Video Recap 提供独立画面与已采用声音的配对方法。适合的情况是画面时钟保持一致,例如修正画面素材或调整已准备好的表现,同时完整配音、原声和音乐都已经确定。
原创例子:一段解说的镜头时长不变,只修复第二个镜头的画面素材。编辑希望保留原混音。另一方案却删除开头三秒并延长结尾,这已经改变时间安排,旧旁白不能直接按原位置套回。
先写本轮改什么、保留什么,核对画面是否删、加、变速或移动。若改变说话动作或事件顺序,即使总时长相同,也要重新检查每个声音对应的内容。
把两份输入明确选出来
| 输入 | 判断与处理 |
|---|---|
| 新画面 | 本例决定: 已独立渲染的 picture.mp4 需要核对: 实际帧率、起点、时长与画面内容 |
| 已定声音 | 本例决定: 旧成片选中的完整 AAC 音轨 需要核对: 确认选中哪一路,包含哪些配音、原声与音乐 |
| 输出 | 本例决定: 新目录里的配对候选 需要核对: 不覆盖旧画面、旧混音与已采用版本 |
在引用版本中,音轨序号按 a:N 计数;旧成片有多路声音时,不能仅凭文件名认为第一路正确。新画面的自带声音会被忽略,声音提供者的画面也会被忽略。
保留完整混音时,不要再生成 TTS 或叠一次 BGM,否则重复处理就破坏了保留目标。
配对能保留什么,不能修什么
对应方法是 video-assemble 下的 scripts/pair_media.py,由明确的两输入计划运行。当前引用实现接受 MP4 家族容器中的 H.264/HEVC 零起点恒定帧率画面与满足时钟要求的连续 AAC 音轨,复制压缩流而非重新混音。
它不自动偏移、变速、裁切、补静音、标准化或用 shortest 截尾。格式或时钟不符合条件时,回上游准备合适输入,不把失败解释成已保留成功。
首尾容差用于检查容器相容,不能证明一句台词对上一次嘴部动作。流与解码检查通过后,仍需正常速度观看与完整听审。
只做输入检查的计划记录会是PLANNED,不产生配对视频;实际配对并通过检查才记录PAIR_RENDERED。FAILED记录不能当候选成功使用,早期输入错误也应按错误处理。计划目录不能复用成渲染目录,继续使用新的输出目录,保留已采用文件。
完整配对计划:指定新画面与真正采用的音轨
沿用前面的“第二镜只修画面、全部时钟不变”例子。下面是一份纸面执行候选:作者选定新画面为/project/picture-v2.mp4,已采用声音来自/project/adopted-final.mp4的第二条音轨,即音频序号1。只有实际检查这些文件、该音轨和内部事件仍对应后,才运行;示例文件并未在本教程中生成。
将下面的完整计划保存为 pair.json:
{"artifact": "media_pair", "schema_version": 1, "picture": {"path": "/project/picture-v2.mp4"}, "audio": {"path": "/project/adopted-final.mp4", "selected_stream": 1}}
把路径替换成自己的实际文件。第二条音轨是本纸面例子选定的来源,不是所有项目都选1;确认它确实包含已经采用的完整旁白、原声与音乐。selected_stream按音频流计数,不是把视频流也算进去的总序号。
进入已安装的video-assemble技能目录后,可用同一计划先检查,再用另一个未存在的目录实际配对:
python3 scripts/pair_media.py pair.json --output-dir pair-plan-check --plan-only
python3 scripts/pair_media.py pair.json --output-dir paired-candidate
两目录都须是本次新名称。第一条只做计划检查,没有成片;第二条才实际复制两输入的画面流和选定声音流。不能把检查目录改名后就称渲染完成。计划没有偏移或裁尾字段,时钟不合要求要回上游修输入。
实际输出paired.mp4的音频序号变成0,声音提供者的画面与新画面的自带声音都未采用。后续字幕绑定这份新文件及a:0;即使原声音来自a:1,也不沿用旧序号。
看片时完整核第二镜新画面、该镜内部说话/动作对应,以及它前后的交接,再听完整混音。包与时钟验证通过后仍可能配了内容错位的声音,见剪后音画不同步排查。本例展示完整计划和顺序,尚未执行命令或验证任何真实成片。
字幕在配对后重新核对
配对后的输出只有一条声音,序号为 a:0。字幕必须绑定这份新容器与输出时间线,不能继续拿旧画面文件、旧成片音轨序号或旧身份记录冒充当前版本。
最终检查三件事:画面确实用了新版本;声音完整来自选定旧音轨;字幕跟当前声音和画面位置一致。若字幕本轮也要改,列出具体行与位置,别重新跑整段解说顺便替换文案。
保留已定声音是一项明确输入决定。机器记录能证明实际消费了哪些文件与流,是否好听、是否符合创作意图仍由实际观看确认。
常见问题
视频总时长一样就一定能直接换吗?
不够。说话、动作与揭示可能已移位,还要检查实际起点、帧时钟与声音对应内容。总时长相同不能替代逐段观看。
用 skill 来做
请通过 video-recap 只改已点名的画面,先核对时间线是否变化,再让 video-assemble 显式配对新画面与我选定的完整声音,配对后重新绑定字幕。
查看具体方法: 独立画面与保留音轨配对 · 声音处理与保留模式 · 明确两输入配对与结果状态