混音入门:人声、垫乐与音效的音量分层
混音听起来专业,核心其实只有一件事:定好主轨,其他都往下让。分层思维加上先统一响度再调比例的顺序,双轨三轨的合成在浏览器里就能做干净。
分层思维:先定主轨,其余都是陪衬
混音的第一件事是确定哪条是主轨。口播视频里人声是主轨,Vlog 里环境声或旁白是主轨。主轨的音量基准定下来,其他轨全部以它为参照往下让,这是混音八十percent的工作。
垫乐轨的常见参考值是比人声低 10 到 15 分贝的听感差距,体现在音量调整上就是把垫乐轨音量乘 0.3 到 0.4。别凭感觉一次调到位,先用这个比例挂着试听,再按内容微调。
音效轨(转场音、提示音)按「出现瞬间听得见、平时不干扰」的原则单独调,通常比垫乐略高、比人声低。每条轨在混音前明确自己的角色,比任何参数都管用。
响度统一:每条轨先各自拉齐再混
不同来源的音频响度差异很大:手机录的人声可能很轻,网上的垫乐可能很响。混音前先把每条轨分别用响度标准化工具拉齐到接近的响度水平,否则混音时的音量比例根本没法估。
拉齐之后再做相对音量调整:主轨不动,垫乐乘 0.3,音效乘 0.6,先混一版试听。这个顺序(先统一、再分层)比直接混省一半的返工。
每条轨单独处理还有个好处:哪条轨有问题(爆音、底噪)一听便知,不会混在一起互相掩盖。混音排错的基本功就是分层听。
拼接与对齐:把多条轨拼成一条
音轨各自调好后,用合并工具把垫乐和人声拼成一条。拼接时注意长度对齐:垫乐比人声长就先裁垫乐,比人声短就用循环补齐,两边都别硬凑。
混音的时序设计比音量更影响听感:垫乐在片头比人声先进入两三秒,片尾在说完之后多留几秒再淡出,这些「呼吸感」靠音频淡入淡出工具做,成本极低效果极好。
多段拼接的顺序结构(片头垫乐-人声进入-间奏-结尾)可以用合并工具按顺序拼,也可以在剪辑时把各段对齐时间轴后一起导出。本地工具适合前者:分段处理、逐段拼接。
常见翻车点:底噪、爆音与相位
混音后听起来「糊」,多数是底噪叠加:两条轨各自都有轻微底噪,叠起来就明显。处理办法是混音前把有底噪的轨单独降噪,混音后再整体降噪一次是补救手段,不是正确顺序。
爆音多发生在拼接点:两段音频衔接处波形突然跳变会发出「啪」声。给每段音频的首尾都加极短的淡入淡出(几十毫秒),拼接爆音基本消失。
声音发虚、人声像隔着水,检查是不是两条内容相近的轨叠加(比如既有现场人声又有后期配音)。同一内容出现两次的轨,留一条删一条,这比任何调参都有效。
输出选择:发布场景决定格式与响度
混完的成品按用途导出:发平台的视频轨用 AAC 就够,单独发布音频选 MP3(兼容性)或 FLAC(存档),中间过程的工作文件保留 WAV/PCM 无损格式,避免反复有损压缩叠加失真。
成品响度别拉满:留一点 headroom(峰值余量),不同平台二次响度标准化时不会压变形。听感上「响」是响度一致和动态合理的共同结果,不是把音量推到顶。
混音是迭代活:导出一版、换设备听一遍(手机外放、耳机、电脑音箱),哪里失衡改哪里。三轮下来基本就能稳定,别在监听环境上过度纠结。