先分清三种容易混淆的声音

drama-skills 的声音方法分别处理画内对白、画外声和旁白。提示词里只写“她说”,却同时要求她闭嘴思考,可能给出互相冲突的目标。

项目记录
画内对白画面需要什么:对应人物的开口、表演和完整台词;例子:店主面对客户说“试车后再交钥匙”
画外说话画面需要什么:声音来自不在画面或口部不可见的人,方向与场景一致;例子:镜头拍店主,客户在对面画外提问
旁白或内心独白画面需要什么:不要求画中人物用嘴说出这一句;例子:店主看钥匙,听见其回忆旁白

同一句话跨镜时,注明在哪一镜开始、下一镜是画外继续还是已经结束。不要前镜写“说完”,后镜又让这句从头出现。

声音登记还包括每句实际语种与逐字原文,不能从提示词正文语言推断。若音频本身说错语言或改了句子,先看发声语种与台词检查,再做本页口型核对。

先测完整台词,再安排开口和反应

有同句、同表演的录音,优先用实际发声时长;没有录音,标明只是文本估计,不假称已经试听。镜头还要容纳开口前的等待、不能同时进行的动作和末尾反应。

下面只是预算示例:假设镜头共 7 秒,等待和收尾各需约半秒,发声窗口只剩 6 秒。若你录下的完整台词需要 8 秒,把提示词写成“0—7 秒说完”并不会使它装得下。可以延长镜头,或在语义合适处拆镜;若要精简台词,先修订剧本,再同步提示词与音频。

可以调整应保住
无必要的抬手、走动和复杂运镜完整台词与正确说话人
能自然同时进行的简单动作必须先后发生的因果动作
镜头时长或合理拆镜结尾能看懂的回应

不同语言、声音和情绪的语速不同,不用一个固定每秒字数当所有模型的容量保证。

双人场景提示词:说话与听话各有职责

以下是原创场景设计,生成后仍需检查。

保持已确定的店内机位,店主在画面左侧,客户在右侧。客户先停手看向店主,不说话。店主面向客户,完整说出:“试车后再交钥匙。”发声属于店主的画内对白,口部表演与这一句对应;客户听完才将手从钥匙旁移开,不跟说、不重复台词。店主说完后保留客户撤手的反应,钥匙仍在台上。不要增加旁白或新台词。镜头时长按完整录音和反应时间安排。

若同框听者总跟着张嘴,分镜允许时可改成店主单人近景,客户的撤手另拍反应;若坚持同框,明确听者不发声、嘴唇闭合,并核生成结果。

内心独白版不能只把同一句改标“旁白”而保留开口动作。可以拍手与钥匙,听见内心旁白;若必须正脸,明确嘴唇闭合并检查。skill 中的小样本观察说明文字限制有时仍会失败,因此不要把“写了闭嘴”当成已经解决。

四类失败,分别修

项目记录
错的人在动嘴优先核对:说话人归属、同框人物与台词顺序;处理:写清声源,必要时改取景
旁白时人物张嘴优先核对:是否把旁白误写成对白;处理:调整分镜或注明闭嘴,再看实际画面
台词尾巴没说完优先核对:完整发声时长是否超窗口;处理:延长、拆镜或先修剧本,不悄悄删字
台词重复跨两个镜头优先核对:前后镜开始、延续与结束关系;处理:对齐相邻提示词和剪辑声音段

回听完整台词,再按正常速度看画内开口与声音是否对应,检查切镜处有没有多说、少说或声源跳变。仅检查提示词、字幕文本或一张截图,都不能证明口型同步。

常见问题

写“口型精准同步”能保证成功吗?

不能。先给正确声源、完整台词和合理时长,再检查实际输出;失败时根据说话人、旁白处理或容量问题分别调整。

可以直接把难同步的对白改成旁白吗?

这会改变表现方式,可能也改变剧情。先确认场景能否这样讲,再修剧本与分镜,不能只在视频提示词里悄悄转换。

用 skill 来做

用 short-drama-video-prompts 请求:“根据这段剧本和分镜写声音与表演提示,标清说话人、完整台词、画内/画外/旁白关系;检查发声窗口,超时先提出延长或拆镜方案,不改台词。”

查看具体方法: 对白、旁白与口部表现 · 完整台词与动作的时长预算

了解 Drama Skills在 GitHub 查看 short-drama-video-prompts

全部指南