ZenStory AI

实用指南

视频解说什么时候保留原声,什么时候加旁白?

源码核对日期 2026-09-13

让真正承载事件的声音先说话:完整原话、开关声和有意义的等待,都不必靠旁白重新解释。需要背景时,只说有依据、观众此刻又确实需要的部分。下面的原创收音机示例先分五拍,再比较减字与去掉一段旁白的取舍:既不把“不舍得换”改成“没钱换”,也不把没有响应的停顿剪没,制造一拨就响的错觉。字幕则区分忠实台词与额外说明,不把“不重复旁白”误解成删掉台词字幕。这是编辑写稿练习,不是已处理的视频或声音效果。

所属项目 Video Recap Skills在 GitHub 查看源码

开始之前

  • 准备获准使用的录像,以及来自实际素材的画面、对白转写与静音窗证据。本页时间戳均为虚构示例,不能直接作为另一文件的安全剪点。
  • 先确定让观众看懂什么。本例是“听见收音机从没有响应到重新响起的变化”,不是“证明师傅诊断并永久修好了故障”。
  • 安装和完整阶段顺序见本地视频到中文解说;已有合成时间轴要继续精修,见可编辑草稿导出

操作步骤

  1. 先给每拍一个主要声音职责visual_audio_board.json 中,用 audio_owner 指明主要承载信息的是原声对白 original_dialogue、动作声 action_sound、环境声 ambience、音乐 music、沉默 silence,还是旁白 narration。这是编导决定,不要求六种都用。本例保留顾客的原话和收音机第一次响起的声音,不在它们上面重新概括一遍。
  2. 只写旁白真正增加的信息 narration_job 可以是背景 context、因果连接 causal_link、伏笔 foreshadow、有依据的解释 interpretation、过渡 transition 或不需要旁白 none。本例“搬家时没舍得换”来自创作者,不是画面证明;缩句时仍要保住这项意思。“没钱换”虽短,却换成了未提供的经济原因。若决定不再明说这段背景,应承认少交代了什么,而不是声称原声已经完整说过。
  3. 把完整句子、动作和停顿一起留下 留下整句原话、说话的表演和引发的反应。拨开关后没有响应,需要观众有机会听出那个等待;如果只留咔嗒便跳到后面的杂音,缩短的可能是理解所需的过程,而不只是“空白”。没有广播声不等于原片所有声音为零,silence 也不要求数字静音。旁白与原声的比例不是配额;其他声音已完成任务时,用 narration_job=none
  4. 剪完以后,换到正确的时钟 剪辑计划选择的是原片区间。编排式 cut 流程先生成 edited_source.mp4,再按成片输出时间写旁白;clip_plan_validated.json 同时记录原片与输出区间。真正写稿时读取这份映射,不照抄下表的草拟加法。full 模式沿用原片时间,旧版单阶段 cut 映射则是另一条路径。
  5. 让声音方案落实到实际旁白窗口 合成器不会读取 audio_owner 自动切音轨。需要通过真实的 narration.json 段落、原声留白、对白证据与混音设置落实。overlaps_speech 描述是否重叠,不是把它设为 false 就能静音原片或保证那里无对白。还要看原声何时恢复:旁白结束后可能继续压低至安全停顿,没有可靠恢复锚点时甚至保持到时间线末尾。
  6. 先减字,不抢下一句原声的时间 六秒画面不代表要说满六秒。让旁白在下一句重要原话之前结束,并留出原声恢复空间。受限变速后仍放不下时,放置阶段可报告 no_safe_fit,不会剪掉尾音伪装成功;应缩短、拆分任务或换窗口,再重做受影响的配音。
  7. 按反馈改对应层,不重新设计整条片 如果只是把第一句说短,保留已选故事、五拍顺序和声音任务,修改表达与对应文案;如果整段去掉旁白,声音分工也随之改变。源码把表达、口语节奏和字幕反馈记入 style_card.json,镜头与声音分工记入 visual_audio_board.json;只有观众承诺、视角、主线或 beat 真正改变时,才修改 recap_story_plan.json。删除的文案不能仍留在相关计划或待用字幕里。改文档不会自动改已生成的 WAV 或混音。
  8. 区分台词字幕与额外说明 忠实字幕可以重复听到的台词,不必为了避免重复而删掉。旁白字幕跟选定口播;如提供 original_subtitles.json,使用输出时间,只写成片中仍能听见的原声对白,不收已经剪掉或被覆盖的话,也不把声音提示、情绪概括塞成对白。字幕换行不等于拆碎 TTS 口播。合成后听完整交接;文字方案或字幕文件不能证明台词在最终混音里保住。

示例

示例

原创编辑示例——《搬家后的收音机》 这里没有生成源文件、ASR 转写、配音或成片。 以下片段与时间均为虚构的编辑示意,不是可导入的 JSON。

创作者提供的背景:老周搬家时没舍得换掉这台旧收音机。 这不是某一帧能证明的事实,须明确来自创作者上下文。 示意中能观察到的事:拨开关后没有响声;师傅重新插接连接头;随后有收音机杂音。 画面没有拆开机壳,也没有证明故障诊断或永久修复。

五段草拟剪辑——原片时间 → 暂拟输出时间: 1. 00:12–00:18 → 00:00–00:06|台上的收音机,无对白。 主职责:narration;任务:context。 旁白:“搬家时,老周没舍得换掉这台收音机。” 2. 00:42–00:47 → 00:06–00:11|老周开口。 主职责:original_dialogue;任务:none。完整保留原话: “早上还响着,搬过来就没声了。”不铺旁白。 3. 01:10–01:14 → 00:11–00:15|开关咔嗒,收音机没有响应。 主职责:silence;任务:none。保留起始的咔嗒声和随后的等待; 这一拍由停顿主导,不是要求静音原片。不要加“他拨动开关”的旁白或音乐。 4. 01:28–01:34 → 00:15–00:21|重新插接后,收音机第一次响起杂音。 主职责:action_sound;任务:none。让观众听见变化, 不把这一刻扩写成已经证明的完整维修过程。 5. 01:52–01:58 → 00:21–00:27|老周的反应。 主职责:original_dialogue;任务:none。完整保留: “还以为它也不肯跟我走了。”让反应结束,不追加无依据的升华。

不该写的解释: “师傅一眼就看出内部电路坏了,拆开机壳便把它修好了。” 素材没有证明这个诊断,也没拍到开壳。更合适的替换是上面那一句背景, 然后把声音位置交还给原话、开关声和停顿。

修订练习——“旁白太满,少说一点”具体改哪里: 下面是对同一五拍方案的编辑比较,不是依次执行的步骤,也没有产生第二版音频或时间轴。

先区分多说与说错: “开关咔嗒一声,收音机没有响应。师傅重新插好连接头,杂音出现了。” 这几句可以是在复述本例观察,并不因为平直就成了假话。但如果把它们铺在第3、4拍上,观众就得隔着旁白去听咔嗒、等待和第一次杂音。本片承诺的是让观众听见变化;重复说明可能抢走证明变化的声音。若另做以口述说明为目的的版本,应另定观众需求,而不是把本例的声音分工当通用禁令。

A. 保留背景任务,只删不必要的重复指代: 原句:“搬家时,老周没舍得换掉这台收音机。” 候选短句:“搬家时,老周没舍得换它。” 画面此时明确呈现台上的收音机,“它”有可见指向;搬家、不舍得换这两项意思仍在。若第一拍换成别的物件、人物特写,或要做脱离画面的纯音频版本,应重新说明指代,不能照搬这次省略。短了几个字也不等于已经证明 TTS 能在原话前安全收住。

不能为了更短,换成“老周没钱换它”;创作者没提供财务原因。也不能从结尾那个“也”字补出“搬家后再没有人陪他”或亲人离世的前史。少写字不授权换事实。

B. 如果作者不再要求明说这段背景,第一拍也可以不写旁白: 先保留原来收音机入场画面和五拍顺序,第2拍仍由“早上还响着,搬过来就没声了”交代这次变化,第5拍仍保留老周完整的反应。这样没有旁白重复替他说话,但“搬家时没舍得换”不再被明确告知;老周的原话不等于逐字提供了这项背景。 这个方案没有删画面,所以不会因为少了一句配音就自动从27秒变短。第一拍的原始环境声细节没有在示例中给出;应查看自己的素材再决定声音归属,不擅自补室内底噪,也不把删旁白等同于静音源片。此处只提出不写旁白,未声称已有可用的无旁白成片。

无论选A还是B,都不要顺手拿掉第3拍咔嗒后的等待。那一拍需要建立“没有响应”,再由第4拍的重新插接与杂音给出后续变化。源片1:14到1:28之间的内容在这份草拟剪辑中被省略了;相邻放映不证明现实里没有间隔或其他操作,更不能改写成“一拨开关就彻底修好了”。本页没有提出新的剪点,也不规定所有等待都必须保留相同秒数。

交接时明确哪个方案被选:A要替换对应旁白稿及待用旁白字幕,不能让字幕仍说旧长句;B要去掉这段旁白及其对应字幕,不把不存在的口播继续留在成片上。两句原声台词与其原声字幕仍按实际可听内容处理。已有配音或混音不会跟着文本自动更新;这里先交编辑决定,实际声音文件处理属于之后另行授权的阶段。

同一条片,字幕该写什么?——仅在另行选定A时的文字示意 忠实字幕把听到的话变成可读内容,这种跨声音与文字的重复有用;要省的是抢占注意的额外解释,不是为了“不重复”而删掉台词字幕。以下不改五拍,也不意味着已经选定或制作了A。

1. 收音机入场:旁白字幕用选定短句“搬家时,老周没舍得换它。”,不沿用旧长句,也不另叠“舍不得的旧物”来替观众概括情绪。 2. 老周说明:原声对白字幕保留“早上还响着,搬过来就没声了。”,不改成旁白口吻“搬家弄坏了收音机”;原话只给出先后,没有证明损坏原因。 3. 咔嗒与等待:这里没有人说话,不编一条对白字幕。若另选声音提示层,可把“[开关声]”作为候选标注;不要让提示替代咔嗒后的等待,也不要抢先写“马上就修好了”。 4. 插接与首次杂音:仍没有对白字幕。可选的“[收音机杂音]”描述声音,不等于“[故障排除]”;后者把一次响应说成了完整诊断和修复。 5. 老周回应:原声对白字幕保留“还以为它也不肯跟我走了。”,不再加“旧物也懂离愁”的结论卡,让这句拟人表达由他说完。

字幕排版可以把第一句显示为两行: 搬家时, 老周没舍得换它。 这只是阅读换行,仍是一个连贯口播,不为每行另做一小段TTS。真正分成多个字幕提示、何时出现和消失,要跟实际语音与输出时间配合;本例没有给出可导入的字幕时码。

方括号声音提示是另提的编辑候选,不是录到的台词,也不是声称流程会自动生成的无障碍字幕。不要把它们塞进 original_subtitles.json 冒充原声对白;另交给选定的字幕/人工精修流程处理。只读台词字幕也不等于已经传达了咔嗒后的等待与声音变化;若另做静音观看版本,需要单独决定怎样表达这些信息。

若最终选B,第一拍的旁白字幕随旁白去掉。作者可以另选一张背景文字卡,但那会把B不再明说的背景重新交代给观众,属于另一项表达选择,不能把遗留的旧字幕说成“只是排版”。

时间说明:第一段有六秒画面,不等于一定有六秒的朗读窗口。 真实配音要在第二段原话前收住,并留下安全的原声恢复空间。 表中边界不证明真实文件在这些位置有停顿,也不证明剪点安全。

交给已配置 Video Recap Skills 的 Agent 的纯文字请求: 使用我获准使用的源片和真实证据,不照抄示例时间。 按以上五段准备故事/声音方案与初步剪辑计划,保留开关声引出的停顿。 完整保留两句原话与收音机首次响起的声音,只使用已确认的搬家背景,其他段不铺旁白。 停在编辑交接,不调用 TTS、不渲染媒体、不添加 BGM;列出未确定的声音和时间证据。 等我选定剪法、剪后文件真实存在,再用校正后的输出时间映射写旁白。

若采用A,可另交一份限定修订请求,而不是重新创作整条片: 这是上述收音机方案的文字修订练习。只把第一拍旁白改为“搬家时,老周没舍得换它。”;本次不采用B。保留观众承诺、五拍顺序、已有画面范围、两句完整原话、咔嗒后的等待和首次杂音,不补贫困、孤独或维修诊断。 返回修改后的候选文案与受影响的表达/字幕交接项;先只在回复里提出,不写入现有产物。第一拍仍是背景旁白任务,不因一句减字而重新设计故事。 不执行剪辑、TTS、音频替换、混音或渲染,不声称已解决真实时长。若实际首镜不能明确指向收音机,说明“它”的歧义并保留名词,不为追求短句牺牲理解。

预期文件

  • 一份明确选定的文案修订:保留哪些背景与原话、删掉什么、是否改变声音分工,以及对应字幕要怎样更新。比较方案不等于已执行两次修改,也不新增必需文件名。
  • recap_story_plan.jsonvisual_audio_board.json:记录观众承诺、变化节拍、来源证据与主要声音职责;它们是决定,不是成品混音。
  • cut 模式的 clip_plan.json 表达原片选段;后续真实的 clip_plan_validated.jsonedited_source.mp4 才确立剪后时间线。不能把草拟表改名当成已执行剪辑。
  • narration.json:只写确有需要的口播段,并用对应时钟;original_subtitles.json 按需记录输出时间上仍可听到的原话。配音文件和成片必须等相应阶段实际执行后才存在。
  • 真实 timeline.json 已存在、还需人工精修时,可走剪映 / CapCut 草稿导出。导出草稿本身不会证明所有声音交接都自然。

验证结果与边界

  • 听实际交接:背景旁白结束后,整句原话是否清楚;开关声与等待是否保住;收尾原句是否被截断。board 中写对标签不能证明这些已经发生。
  • 工作流可能在旁白附近压低原声,并延迟到安全锚点才恢复。不能保证书面旁白区间以外的每个声音都原封不动;要听实际混音,调整受影响的放置,或在编辑器内精修。
  • 本编辑示例没有运行真实视频、转写、TTS、音乐、媒体生成或播放。实际项目另有模型/媒体服务配置与素材授权要求;本页不保证自动得到最佳混音,也不规定旁白必须占多少比例。

来源与版本说明

了解 Video Recap Skills全部指南