有声书制作:从录音到成品章节的完整链路
录完一本三小时的有声书,回放时才发现:有的章声音大有的章声音小、开头结尾有咳嗽和口误、二十个文件在播放器里乱序。有声书制作的技术部分不复杂——分章、修音、统一响度、合并,四个环节按顺序走完即可。
两种来源,同一条链路
自己朗读的录音:手机或麦克风录下,环境底噪与音量波动需要处理。语音合成的产物:TTS 生成的章节音频,干净但可能各章响度不一、停顿生硬。两种来源走同一条后处理链路:分章确认 → 截取修饰 → 响度统一 → 合并导出。
来源不同只影响第一环的工作量:录音要降噪与截口误,合成语音通常跳过这两步直接进响度环节。
先分章再处理
按章节组织文件:一章一文件(或一小节一文件),文件名补零排序(01、02……)。不要先合并再修——三小时的合并大文件一旦某处出问题,重做成本极高;分章处理则每章独立可重做。
录音时按章停顿分段录制,天然得到分章文件;如果录成了一个大文件,先用截取工具按章节切开再继续。
截取修饰:去掉坏口与死时间
每章开头结尾的处理:掐掉咳嗽、翻纸、设备碰撞声;朗读开始前和结束后的死时间各留 0.5 秒左右的呼吸感,不要掐到贴字。章中的长停顿(超过 3 秒的空白)与明显口误重录段,截取或剪掉。
章内不需要逐句修——有声书的听感重点是"连贯与均匀",偶尔的自然停顿反而是节奏。只处理明显的坏段。
响度统一:听感的最大变量
三小时内容里最影响体验的不是音质而是响度:章与章之间音量跳变、朗读书中对话时音量骤降——听众会不停调音量。用响度统一工具把每章拉到同一目标响度,章内增益变化自然收敛。
处理顺序:先逐章统一到目标响度,再合并成整书——顺序反了,合并后的统一是"平均"而非"每段正确"。
合并与发布的颗粒度
发布颗粒度按平台来:支持章节列表的听书平台保留分章文件(一章一文件上传,平台自动按序播放);只吃单文件的场景(U 盘、网盘给老人听)合并成整本或按部分合并(每 5–10 章一个文件,单个 1–2 小时,拖动定位不痛苦)。
合并同样要求参数一致:分章处理时统一了采样率与格式,合并就是流复制,秒级完成。
格式与码率:纯人声的减法
有声书是纯人声内容,码率可以做大幅减法:AAC 64kbps 或 MP3 96kbps 对人声完全够用——听感与 192kbps 无差别,体积差三倍。三小时的书按 64kbps AAC 算约 85MB,网盘与手机存储都友好。
格式选择:mp3 兼容面最广(老设备、车载都认),m4a/aac 体积更小、现代设备全支持。格式的完整选择逻辑在音频格式选择专题里有展开,纯人声场景取"够用就好"即可。