先把“不加旁白”说成具体声音决定

没有旁白不代表没有声音设计。原对白、动作声、环境声与沉默可以承担内容;选择保留哪些,再决定怎样合成。

需求video-assemble 的实际方式
调整当前原声音量,或加入已选音乐source-mix:不生成旁白,但会按配置处理声音,包含末级响度或限幅处理。
原音轨已采用,要求原编码音频不被处理adopted-packet-copy:复制符合条件的 AAC 流,核对音频包与时间,不再混音。
新画面与另一文件中的完整混音配对先用独立配对方法,不把新画面的原声冒充已采用混音。

source-mix 不是冻结音轨。“没配音”也不等于“声音没变化”。复制方式支持的输入较窄,必须核对实际编码、选中音轨和音画区间,不能只凭扩展名判断。

给执行者一段不含糊的请求

下面是一份可填写的操作请求,不是可直接运行的脚本:

当前输入:___;当前采用版本:___。

不增加旁白,不读取旧 TTS 当作新声音。

需要:处理原声 / 保留已采用完整音轨,两者选一。

保留音轨:___;如有多音轨,先试听确认说话声所在轨。

音量或配乐决定:___;未选择新音乐就不追加 BGM。

画面范围与字幕要求:___;导出新候选,不覆盖已采用成片。

完成后说明实际处理,并回听原话、接点与尾声。

默认入口是 narration。选无旁白时明确 --audio-mode source-mix 或 --audio-mode adopted-packet-copy;--audio-stream-index 选择的是零起点的音频流序号。音轨复制不能同时带 TTS、配乐配置或不支持的编码;输入不符合时先报告,别自动改成混音后仍称复制成功。

原创示例:保留一段手工修补的原声

假设素材是一段手工修补示范:老师先说明针法,停下说话做示范,最后让学员试一次。原声已经包含完整解释与操作声,不需要另配解说。

若要稍调声音并加已经选好的轻音乐,使用 source-mix,明确保留老师原话与学员回应。导出后回听示范期间的操作声有没有被盖住,不把无说话段当作需要音乐填满的空白。

若现有 AAC 音轨已经完成混音并采用,要求只变画面包装,就先判断复制条件;通过后保留这条声音,不再叠音乐或跑一遍响度处理。实际包校验通过只能证明复制满足合同,还需要听完整片段判断内容是否正确、是否选中了目标轨。

这里是制作决策示例,没有运行或听审结果。若既要删改画面时长又要保持另一版声音,先重新解决音画区间,不用截掉音频尾部让两者勉强相等。

原声示例:保留老师解释、操作声与学员回应

沿用手工修补示范,选择一条具体的已采用AAC复制路线。以下十秒内容、时间和台词为本例原创,补在上面的混音或复制选择之后,没有真实文件或听审。

输出区间必须听见、看见什么
0—3秒老师指着布料说“先看我做这一针”,说明完整说完。
3—6秒老师示范,画面连续看见针通过、线收紧;保留布料和线的原操作声。
6—10秒老师说“现在你试一次”,学员答“从这里开始吗”,老师答“对”;学员开始动作。

假设这十秒已剪好、画面时长不改,视频内音频流0是已听过并采用的完整AAC声音,包含以上对白和操作声。本轮只做所选画面包装,不加音乐或旁白。实际项目先验证文件、音轨与音画区间是否满足复制条件;不符合时不把假设预填为通过。

执行者明确选择--audio-mode adopted-packet-copy、--audio-stream-index 0,不带TTS或BGM配置,另出候选。复制路径不重新混音、压低、归一化或裁短;包装可以重新编码画面,复制后的音频仍要过实际包与时间核对。原片已有字幕或新包装文字,各按已经确定的视觉决定处理,不因无旁白就自动删除。

最终从“先看”连续听到“对”和后面的动作,核6秒附近没有截掉老师句尾,学员回应没有被旧配音或音乐遮住。3—6秒没有说话也有示范声音,不用背景音乐填满。包匹配证明采用声音被复制,不能代替已经选中正确轨和内容听审。

若后来想删掉两秒等待,重新交代画面与声音的改动范围,再形成一条新的完整声音方案;当前十秒复制候选不能直接剪成八秒还称整条原音轨没变。学员只是开始试针,不由十秒片段证明已经学会;按画面实际停点交付。

导出后核对处理记录和实际声音

先看 assembly_qc.json 实际采用的模式、音轨与处理,再正常速度听开头、原对白、每个接点和结尾。不加旁白的片也可能选错轨、叠上旧配音、截断句尾或多处理一次已定混音。

想导出剪映草稿时另核能力:当前无旁白导出只支持所选音频流 0,其他选择会失败,不能默认换回 0。字幕和包装也要作为独立需求说明,不因没生成 TTS 就假定全部旧字幕都已消失。

原片字幕、旁白字幕与新标题是不同层;保留或删除哪一层按本次决定落实。只检查到文件或包时,记录技术结果,别把它叫成已回听或已完成内容验收。

常见问题

保留原声是不是就是无损导出?

不一定。source-mix 会处理并编码声音;符合条件的 adopted-packet-copy 可以复制音频包,但画面仍可能重编码。要明确哪一条流保持什么,再核输出,不把整部视频都称无损。

用 skill 来做

请按 video-assemble 的无旁白方式处理:先确认原声是否已采用,再选择 source-mix 或 adopted-packet-copy。列实际音轨、配乐/音量决定及输入限制;不生成空TTS、不默认叠BGM,导出新候选并说明还需回听的内容。

查看具体方法: 无旁白音频模式与复制边界 · 输入、默认模式与合成入口 · 独立画面与已采用音轨配对

了解 Video Recap Skills在 GitHub 查看 video-assemble

全部指南