粗转写时段只负责帮你找到附近
自动转写的一段开始和结束可以来自固定分片,句子会跨过分片边界。转写里有字,表示这一范围值得回听;不表示第一个字恰好从开始时刻发出,也不表示最后一个字在结束时刻说完。转写为空同样不能证明没有轻声对白、动作声或识别失败。
剪辑前先确认转写描述的是当前源文件。源视频、音轨或人名表已经变化时,旧结果只能作为旧版本线索。找出目标句后,从范围前面开始听,到句子、停顿和相关反应都清楚为止,再写实际采用的入点与出点。
可复制的粗转写到剪点两列卡
| 项目 | 填写内容 |
|---|---|
| 当前源文件 | <文件与版本;确认转写对应它> |
| ASR粗范围 | <只作为搜索起点> |
| 粗文本 | <原转写;标出人名、否定词和残句风险> |
| 回听范围 | <向前、向后扩到哪里才听清> |
| 实际整句 | <逐字确认;听不清处标待确认> |
| 源入点与出点 | <按完整声音、动作和反应选择> |
| 必须保留 | <条件、否定词、说话人反应或动作结果> |
| 当前成片位置 | <完成剪辑后读取,不从源时码猜> |
| 后续绑定 | <字幕、旁白、音效使用哪一条当前时间轴> |
每个目标句写一行。先完成来源和听审,随后才填剪点;成片位置留到当前剪辑生成后填写。
原创例子:四个粗范围里藏着三句完整交代
下面是本文虚构的修理台视频与纸面时码,用于演示流程。没有真实ASR运行、回听或剪辑结果。视频中,维修员岑宁要把两个外形相同的收纳箱交给同事江旭:蓝标签箱装已登记的转接头,绿标签箱仍待清点。
假设粗转写给出:
| ASR粗范围 | 粗文本 |
|---|---|
| 0.00—6.00 | “蓝标签箱留在前台” |
| 6.00—12.00 | “周五之前” |
| 12.00—18.00 | 空文本 |
| 18.00—24.00 | “五点以后来取” |
从这张表看不出第一句在哪个范围内结束,也看不出空范围是否安静。本文为纸面演示另行设定:回听0.00—12.00后,完整原声位于4.80—7.90:“蓝标签箱留在前台,周五之前别送走。”岑宁说完后,江旭把手从蓝箱移开。回听12.00—18.00时,在14.20—15.10能听见岑宁轻声补一句:“绿的还没清点。”18.00—24.00内,江旭在19.10—21.20说:“那我五点以后来取蓝的。”
这些边界和台词全是原创教学设定。实际项目必须回听自己的当前文件,不能照搬本例数字。
按完整含义选源剪点
本例若只按0.00—6.00保留第一段,会丢掉“周五之前别送走”的条件和句尾。若把12.00—18.00当静音删除,又会丢掉绿箱仍待清点的区别。较完整的纸面选择如下:
| 片段 | 源范围与保留理由 |
|---|---|
| A | 4.70—8.40;保留蓝箱完整条件,以及江旭把手移开的当前反应 |
| B | 14.10—15.40;保留绿箱未清点的完整补充,不把它并入蓝箱规则 |
| C | 19.00—21.50;保留江旭的取件回应与“蓝的”指代 |
这些入出点只适用于本例。真实素材中,句前紧接前一人说话、句后还有决定性动作或画面切点时,范围要随实际声音和动作调整。ASR负责把编辑带到附近,最终边界来自当前素材的回听与观看。
剪完后重新记录成片时码
假设本例把A、B、C依次排列,且每段前面另有已定画面。源时码4.70—8.40不会自动变成成片4.70—8.40;删除、重排、变速和帧边界都会改变输出位置。完成当前剪辑后,从成片实际时间线读取三段位置,再把字幕、旁白和音效绑定到这条输出轴。
修改A的入点或出点后,B与C的输出位置也会移动。只给全片字幕统一加一个偏移量,无法处理局部长度变化。旧剪辑的输出时码、原片时码和新剪辑的输出时码分别记录,不能混写为一列“时间”。
从粗转写到当前成片的操作顺序
- 锁定当前源文件、采用音轨和对应转写。
- 用关键词找到粗范围,同时查看前后相邻范围。
- 回听实际字词、说话人、句子起止;空文本范围也要听。
- 连画面检查动作与反应,选择完整源入点和出点。
- 记录必须保留的条件、否定词、指代和结果。
- 生成当前剪辑后,读取真实输出位置。
- 让字幕、旁白和音效使用当前成片轴,再完整播放与只听声音。
回听发现原声本身残缺时,保留待补录、换素材或重写状态。字幕写全不能补出不存在的声音,淡入淡出也不能恢复被源文件截掉的字。
五种常见误用和直接修法
| 误用 | 直接修法 |
|---|---|
| 把分片开始当第一个字 | 向前回听,找到实际句首和前一句边界 |
| 把分片结束当句末 | 向后回听,保住条件、否定词和尾字 |
| 空文本等于静音 | 播放该范围,分别记录对白、动作声和真实安静段 |
| 修剪后沿用旧输出时码 | 从当前成片重新读取位置并更新下游绑定 |
| 只听台词,不看反应 | 连画面检查说话人、指代物、动作完成与听者回应 |
先修会改变含义的边界,再处理无作用等待。完成纸面计划不等于已经回听或导出;实际结果只由当前文件的播放与检查支持。
常见问题
ASR某一段没有文字,可以直接放旁白吗?
先听当前音轨。空文本原因可能是轻声、动作声、识别失败或真实安静;只有实际核对后,才能决定原声、动作、沉默或旁白谁承担这一段。
用 skill 来做
用 $video-recap 处理我提供的当前视频,只运行理解与分析阶段,写出粗转写、理解索引和创作简报后停止。列出目标对白所在的粗范围,并明确它们不是精确句界;空文本不当作静音证明。随后回听当前源文件再确定剪点,剪后另记成片时码。
查看具体方法: 公开视频解说入口与理解阶段暂停点 · 视频理解流程与粗粒度转写边界 · ASR粗范围、空文本与时间轴数据说明 · 粗转写精度与当前文件绑定实现 · 写稿前的素材、对白与时间线核对