先单独连听配音,找音量差来自哪里
把相邻几段WAV按实际顺序连听,再比较加音乐后的成片。同一声线也会因为语气、参考音频、停顿长度或生成结果而有电平差,不能只看音色名称相同。
| 差异出现在哪里 | 先检查 |
|---|---|
| 独立配音已一段响一段轻 | 当前WAV的电平、峰值、生成设置与有意表演 |
| 独立配音顺,混完却听不清 | 音乐、原声与旁白的位置和局部比例 |
| 只有一个字特别刺耳 | 瞬态或表演,不把整段无限调低就算解决 |
| 轻声段是人物有意压低声音 | 是否仍可辨、有上下文;不把所有语气拉成一样响 |
先保存当前候选,再改最明显的几段。改完独立声音也要重新放回混音里听;耳机、手机扬声器上的可辨性都来自实际输出,不由一行目标值保证。
逐段归一会受峰值约束
引用版本的 video-voiceover 默认对每段16-bit PCM WAV做RMS归一:目标为−20 dBFS,线性峰值上限为0.98。这是该版本的默认设置,可以改变,不是所有平台的交付标准。
实现先按整段采样计算RMS并求所需增益,再用峰值约束增益,最后记录实际输出。它是在整段上乘同一个系数,不是把一个过高瞬态单独压平的压缩器。目标增益碰到峰值上限,就可能无法达到目标。
分段元数据里的 rms_dbfs_before、rms_dbfs_after 与 peak_after 是归一阶段的记录;没有归一记录的空值不能读成“已达标”。声音后续经过适速、叠轨或编码,这些值也不自动代表最终文件。检查你这次实际采用的WAV与设置,而非拿旧缓存或旧报告说明新声音。
RMS包含整段采样,长静音会拉低均值;两段RMS一样,也可能因停顿、声线和频率分布而听起来不同。先听,确认停顿是否有创作作用,再决定修表演或时间安排,不为数字接近就删掉必要呼吸。
原创演算:不是每段都能加到同一目标
以下是为了说明增益约束的假设数值,没有生成或试听过这些音频。暂不考虑采样取整,统一以−20 dBFS RMS为演算目标。
| 段落 | 输入与预期结果 |
|---|---|
| A,较轻、峰值低 | 输入RMS −26 dBFS、峰值0.20;约加6 dB,幅度约乘2,可到−20,峰值约0.40 |
| B,较轻但有高峰 | 输入RMS −26、峰值0.75;约乘2会使峰值到1.50,超过0.98。增益最多约1.31,即+2.32 dB,输出RMS约−23.68,峰值约0.98 |
| C,整体较响 | 输入RMS −18、峰值0.50;约减2 dB,幅度乘0.79,输出RMS −20,峰值约0.40 |
A和C可以靠整段增益缩小差异,B仍偏轻的原因却是高峰值,不是参数没写对。继续把B整体推到−20会违反本例峰值约束。回听究竟是必要强调、异常尖声还是素材问题;需要处理瞬态时另用音频工具,或修正表演重生成,再检查当前声音。不把代码的增益限制称为已经做了压缩器或真峰测量。
B与其他段还有数字差也不一定必须重做:实际连听可懂且强调符合表达时,可以保留。修订的目的在可辨与自然,不在让每行报告完全相等。
混音完成后,再测成片与回听
逐段归一不负责混音乐、压低原声或渲染字幕。独立声音合适后,按各段用途安排音乐、原对白和旁白,再检查整片。
短剧声音方法要求混音后测量编码输出的实际LUFS与真峰,并指出两遍 loudnorm 不保证恰好达到目标;峰值或动态范围不允许线性增益时,可能转为动态处理。−20 dBFS RMS、目标LUFS和编码后实测LUFS是不同量,不要把它们互相替换。WAV的样本峰值0.98,也不证明编码成片的真峰已经通过。
整片测量通过后,仍逐句连听:有没有只有某一段轻到漏词、音乐在一句中途突然冒起、接缝切断呼吸、轻声被拉成喊叫。若问题来自音乐遮盖,回混音改局部比例;若来自语音表演,回该段修,不反复标准化全片碰运气。
保存修前与修后候选、实际设置和本次测量。没有测过或听过的输出写为待测/待试听,不把预设目标当成完成结果。
常见问题
把所有段音量都设成100%就一样响吗?
不会。相同播放增益不代表输入音频的电平一样。先比较实际WAV与表演,再用峰值约束下的增益调整,最后连听。
全片LUFS达标,为什么还是有一段太轻?
整片响度汇总不能证明每段相对平衡。该段可能有意轻声、原始电平较低、受高峰值约束或被音乐遮盖;单独与混音分别回听,再修对应原因。
用 skill 来做
请通过 video-recap 对比音量不一致的配音段,先单独试听并检查当前WAV的RMS与峰值及归一设置。解释不能达到目标的段落,不反复加增益冲破峰值。保留有意的轻声与强调,修后重新混音,再测量成片LUFS与真峰并试听。
查看具体方法: 逐段配音与输出证据 · RMS归一与峰值增益约束 · 当前默认归一设置 · 混音后测量实际响度和真峰