先固定终版,再记录三个以上检查点

在 ZenStory 的视频解说工作流中,字幕时间使用最终输出时钟。若字幕最初按原素材计时,先建立从原素材到剪辑成片的时间映射,再把每条字幕边界落到成片时钟。完成时间映射后,创作者仍要重播准备发布的视频画面 + 这版成片实际采用的旁白,亲自确认声音与字幕的开始和结束。

先给成片和旁白版本做清楚标记,在开头、中段、结尾各选一句起音和收音都容易辨认的台词。若某处有叠音、含混起音或难以判断的句尾,就换一个更清楚的句子。记录表中的时间必须来自实际播放观察;看不清的值写“未知”,不要猜。

项目记录
开头附近台词标记: [原句或唯一标记]; 声音开始: [已观察/未知]; 声音结束: [已观察/未知]; 字幕开始显示: [已观察/未知]; 字幕结束显示: [已观察/未知]; 开始误差(字幕-声音): [正数=字幕晚出现;负数=字幕早出现]; 结束误差(字幕-声音): [正数=字幕晚消失;负数=字幕早消失]; 备注: [叠音、含混句尾等]
中段附近台词标记: [原句或唯一标记]; 声音开始: [已观察/未知]; 声音结束: [已观察/未知]; 字幕开始显示: [已观察/未知]; 字幕结束显示: [已观察/未知]; 开始误差(字幕-声音): [同上]; 结束误差(字幕-声音): [同上]; 备注: [说明]
结尾附近台词标记: [原句或唯一标记]; 声音开始: [已观察/未知]; 声音结束: [已观察/未知]; 字幕开始显示: [已观察/未知]; 字幕结束显示: [已观察/未知]; 开始误差(字幕-声音): [同上]; 结束误差(字幕-声音): [同上]; 备注: [说明]

开始误差只支持开始边界的判断,结束误差只支持结束边界的判断。某条字幕只有开始时间可辨时,把结束边界保留为“未知”,先补测再决定是否修改。开头、中段、结尾三个位置构成第一轮模式检查;发现转场、分段或局部重剪附近有异常时,在该处追加检查点。

此表是人工观察用编辑卡,不是原生subtitle_track.json格式。原生轨道使用最终输出时钟和既有媒体绑定;加载器保留已写边界与文字,不自动做声音对齐、源时间映射或边界修复。两列表中各字段仍分别记录,不能只写一个“已同步”。

按误差形状分别处理三类问题

这套人工方法比较终版媒体中实际观察到的开始误差与结束误差,再为证据选择相符的修正范围。字幕轨以最终输出时钟记录边界;创作者通过重播成片确认这些边界与实际语音的关系。

项目记录
开头、中段、结尾的开始误差与结束误差都以相近方向和幅度提前或延后诊断: 整体偏移:整条字幕的边界整体错开,但各条显示时长大致保持; 证据支持的修正: 按已核对的共同误差整体平移字幕;字幕晚就前移,字幕早就后移,并保持各条原有时长。这个判断需要开始和结束两侧都有相符证据
开头接近,中段更偏,结尾偏得更多;开始或结束误差沿片长持续变化诊断: 持续漂移:字幕与终版声音没有共享同一套时长变化; 证据支持的修正: 先核对SRT、旁白和视频是否来自同一最终版本;对最终旁白重新建立开始与结束时间,必要时按已验证的分段锚点重定时。一次整体平移只校正一个位置
大部分检查点相符,只有某一句或相邻几句的开始或结束异常诊断: 单条边界错误:局部边界或局部剪辑需要修正; 证据支持的修正: 只改有实测证据支持的开始或结束边界,并重播该条与相邻交接;未观察到的另一侧保持不动,直到补齐证据

一条轨道也可能同时有整体偏移和少量单条错误。先修共同偏移,然后在新导出中重新观察每个检查点的字幕开始、字幕结束、声音开始和声音结束;这轮复测仍显示局部边界异常时,再对该边界单独重定时。若结束仍是未知,就保持结束边界不动并补测。检查点太少或方向互相矛盾时,将分类保持为“证据不足”并增加实测点。

AI只能整理已观察数据,不能从文字证明同步

模型可以把你记录的误差排成表格、指出可能的形状,并列出下一轮要复查的位置;它没有播放终版媒体时,不能知道真实起止点,也不能替你发明时间码。可复制下面的模板。方括号没有实测值时保留“未知”。

我在检查最终视频与实际采用旁白的字幕同步。只能使用下列人工播放记录,不得补写、推算或假设缺失时间。

最终视频版本: [文件名/版本]

采用旁白版本: [文件名/版本]

SRT版本: [文件名/版本]

检查点:

- 开头:[台词标记];声音开始 [已验证/未知];声音结束 [已验证/未知];字幕开始显示 [已验证/未知];字幕结束显示 [已验证/未知]

- 中段:[台词标记];声音开始 [已验证/未知];声音结束 [已验证/未知];字幕开始显示 [已验证/未知];字幕结束显示 [已验证/未知]

- 结尾:[台词标记];声音开始 [已验证/未知];声音结束 [已验证/未知];字幕开始显示 [已验证/未知];字幕结束显示 [已验证/未知]

- 额外异常:[台词标记与四个已验证时间;没有观察到的字段写未知]

只为数据完整的边界计算误差:开始误差=字幕开始-声音开始,结束误差=字幕结束-声音结束。按现有证据归为整体偏移、持续漂移、单条边界错误、混合问题或证据不足;未知项必须保持未知。说明依据,但不要声称已经同步。若证据不足,列出需要我回到成片补测的具体边界。最后只给与证据相符的修正范围,并列出重新导出后必须人工重播的开始与结束检查点。

模型给出的分类仍然是工作建议。最终判断来自修正后成片的播放结果,而不是表格或提示词本身。

原创示例:共同晚0.8秒,另有一条局部异常

下面是本文原创的虚构项目记录,用来演示计算与修正顺序,不报告真实媒体测试结果。一条五分钟的纸灯笼折叠教程采用最终旁白 lantern-fold-final-03。创作者播放终版后记录:

项目记录
开头台词标记: “把方纸沿对角线对折”; 声音开始: 00:12.4; 声音结束: 00:15.6; 字幕开始: 00:13.2; 字幕结束: 00:16.4; 开始误差: +0.8秒; 结束误差: +0.8秒
中段台词标记: “撑开纸袋,再压平折痕”; 声音开始: 02:18.1; 声音结束: 02:21.7; 字幕开始: 02:18.9; 字幕结束: 02:22.5; 开始误差: +0.8秒; 结束误差: +0.8秒
结尾台词标记: “把流苏穿过下方纸环”; 声音开始: 04:41.6; 声音结束: 04:45.0; 字幕开始: 04:42.4; 字幕结束: 04:45.8; 开始误差: +0.8秒; 结束误差: +0.8秒
额外异常台词标记: “把折起的尖角转向中心”; 声音开始: 03:06.0; 声音结束: 03:09.4; 字幕开始: 03:08.0; 字幕结束: 03:10.2; 开始误差: +2.0秒; 结束误差: +0.8秒

开头、中段、结尾的开始和结束都稳定晚 +0.8秒,这份双边界证据支持把整条字幕前移0.8秒,同时保持各条显示时长。额外字幕的开始比共同偏移多晚 1.2秒,但结束只晚共同的0.8秒。

创作者先整体前移0.8秒并重新导出,不直接改额外字幕。随后在新成片中重新观察四个检查点:前三条的开始与结束误差都变为0;额外字幕变为开始 03:07.2、结束 03:09.4,相对声音仍是开始晚 +1.2秒、结束误差为0。复测证明只有这条的开始边界仍有问题,因此创作者把它的开始改到 03:06.0,保留已有证据支持的结束 03:09.4,再检查前一条结束、这一条起止和后一条开始,确认没有意外重叠、显示区间被截短或过长空档。

修完后,创作者重新导出视频,重播所有开始与结束检查点,再顺序观看整片。这些数字只用于说明这份虚构记录的计算;实际项目应使用各自终版中观察到的边界。若实际观察到的开始与结束误差沿片长从 +0.2 增至 +1.1、再增至 +2.0,就不应照抄“整体前移0.8秒”,而应按漂移路径核对版本并重新定时。

本例选择贴合声音起止作为目标。其他项目如有已接受的阅读余量或有意跨镜对白,先按其展示方案判断哪些误差是不需要的;这里的0秒和0.8秒不构成全行业容差或强制标准。

修正后重播成片;旁白变化或影响时间的剪辑后重新检查

时间表记录预期边界;渲染后的媒体显示字幕实际何时开始、何时结束,以及它与语音起止的听感是否同步。用这份只针对时间的清单收尾:

  • 本轮使用的是准备发布的视频、实际采用的旁白和完整SRT,而不是混用旧版本。
  • 开头、中段、结尾的声音起止与字幕显示起止已经在新成片中重播。
  • 每个局部异常及其相邻字幕的起止边界已经重播,没有意外重叠、显示区间被截短或过长空档。
  • 转场、分段、局部变速或改变字幕相关时间顺序的重剪附近已增加检查点。
  • 已从头到尾顺序播放一次,确认各条字幕按预期顺序出现和结束,没有残留到下一句或提前消失。
  • 准备发布的文件就是刚刚检查的那一版。

旁白一旦重录、改词、换语速或调整停顿,需要在新成片中重新检查相关起止点;如果变化改变了总时长,还要复查后续检查点。视频剪辑只有在改变字幕相关的时间、顺序、时长或时间轴位置时,才会使对应时间证据失效。单纯调色、改封面或其他不改变时间轴的操作,不需要因此重做字幕计时检查。

常见问题

为什么SRT开头对得上,越到后面越不同步?

这更像持续漂移,而不是单纯的起点偏移。先分别检查开头、中段、结尾的声音起止与字幕显示起止,再确认SRT、旁白和视频来自同一终版。若开始或结束误差沿片长增长,应依据最终旁白重建对应边界;一次整体平移只能修好某一个位置。

可以让AI直接根据SRT文本判断字幕是否同步吗?

不能。仅看文字无法知道终版声音何时开始和结束,也不能知道字幕在渲染后何时出现和消失,更不能证明观看时已经同步。AI可以整理你从成片中人工核对的起止时间、计算有完整数据的误差和提出复查范围,但未知值必须保留为未知。

只改了一句AI旁白,还要重新检查整条字幕吗?

要在新成片中复查改动句的声音起止与字幕起止。若替换句改变了时长、停顿或后续字幕的时间轴位置,还要重测改动前、改动处和片尾;若只是视频调色等不改变字幕相关时间轴的操作,则不需要因此重做计时检查。旧旁白版本的结果不能证明新旁白同步。

用 skill 来做

使用 /video-recap(Codex 中用 $video-recap)整理字幕同步问题时,请提供准备发布的视频版本、实际采用的旁白版本,以及你从成片人工核对的开头、中段、结尾声音起止和字幕显示起止。要求它只按实测数据区分整体偏移、持续漂移或单条边界错误,并保留未知项;不要让它发明时间码或声称仅凭文本已经同步。

查看具体方法: 输出时钟、双边界与轨道验证范围

了解 Video Recap Skills在 GitHub 查看 video-recap

全部指南