技术原理 约 5 分钟
音频为什么能压到十分之一:心理声学压缩的原理
CD 音质的 WAV 每分钟约 10MB,压成 MP3 只剩 1MB,耳朵却几乎分不出——这十倍差距不是"丢掉了九成信息",而是"扔掉了人耳本来就不处理的信息"。
人耳不是麦克风:听觉的盲区
麦克风记录声音频段内的所有能量,人耳却 selective 得多:20kHz 以上的振动听不到;安静环境里 30dB 以下的声音被听觉阈值过滤;不同频段的敏感度差异巨大——对 1-5kHz(语音频段)极敏感,对极低频和极高频迟钝。
编码器第一步就是按"听觉阈值曲线"分配精度:听不见的频段大幅降精度甚至直接置零。这部分"信息"确实丢了,但丢了也不产生听感差异——这是有损压缩的第一层节省。
掩蔽效应:大声音吃掉小声音
第二层节省来自掩蔽:一个响亮的声音会"遮住"它邻近频段里的微弱声音——鼓点炸响的瞬间,同时存在的轻微底噪根本听不见;频率上靠近的两个声音,响的那个会盖住弱的那个。
编码器利用这一点做"按需分配":在每个时间片段里分析频谱,响亮成分周边的微弱成分少分配甚至不分配比特——反正你也听不到。音乐里大部分时间都有强信号在"打掩护",于是掩蔽几乎全程生效。安静段落(只剩微弱信号)才真正费比特,这也是为什么-encoded 间隙处码率分配最低。
码率档位:允许扔多少
MP3/AAC 的码率档位本质是"允许编码器扔多少"的预算:128kbps 时预算紧张,编码器把阈值和掩蔽的判定调激进,偶尔在复杂乐段露出可闻的"水声"伪影;192kbps 以上预算宽裕,判定保守,伪影基本消失;320kbps 对绝大多数人和素材已是透明。
理解原理后回看压缩决策:语音内容频段窄、掩蔽充分,64kbps 单声道就很干净;古典乐动态范围大、安静段落多,要 256kbps 起步。用频谱图能直接看到有损压缩的痕迹——16kHz 以上的整齐截断,就是编码器"扔掉听不到的高频"的物证。