跳转到主要内容
工作流6 分钟

有声书制作:从录音到成品章节的完整链路

录完一本三小时的有声书,回放时才发现:有的章声音大有的章声音小、开头结尾有咳嗽和口误、二十个文件在播放器里乱序。有声书制作的技术部分不复杂——分章、修音、统一响度、合并,四个环节按顺序走完即可。

两种来源,同一条链路

自己朗读的录音:手机或麦克风录下,环境底噪与音量波动需要处理。语音合成的产物:TTS 生成的章节音频,干净但可能各章响度不一、停顿生硬。两种来源走同一条后处理链路:分章确认 → 截取修饰 → 响度统一 → 合并导出。

来源不同只影响第一环的工作量:录音要降噪与截口误,合成语音通常跳过这两步直接进响度环节。

先分章再处理

按章节组织文件:一章一文件(或一小节一文件),文件名补零排序(01、02……)。不要先合并再修——三小时的合并大文件一旦某处出问题,重做成本极高;分章处理则每章独立可重做。

录音时按章停顿分段录制,天然得到分章文件;如果录成了一个大文件,先用截取工具按章节切开再继续。

截取修饰:去掉坏口与死时间

每章开头结尾的处理:掐掉咳嗽、翻纸、设备碰撞声;朗读开始前和结束后的死时间各留 0.5 秒左右的呼吸感,不要掐到贴字。章中的长停顿(超过 3 秒的空白)与明显口误重录段,截取或剪掉。

章内不需要逐句修——有声书的听感重点是"连贯与均匀",偶尔的自然停顿反而是节奏。只处理明显的坏段。

响度统一:听感的最大变量

三小时内容里最影响体验的不是音质而是响度:章与章之间音量跳变、朗读书中对话时音量骤降——听众会不停调音量。用响度统一工具把每章拉到同一目标响度,章内增益变化自然收敛。

处理顺序:先逐章统一到目标响度,再合并成整书——顺序反了,合并后的统一是"平均"而非"每段正确"。

合并与发布的颗粒度

发布颗粒度按平台来:支持章节列表的听书平台保留分章文件(一章一文件上传,平台自动按序播放);只吃单文件的场景(U 盘、网盘给老人听)合并成整本或按部分合并(每 5–10 章一个文件,单个 1–2 小时,拖动定位不痛苦)。

合并同样要求参数一致:分章处理时统一了采样率与格式,合并就是流复制,秒级完成。

格式与码率:纯人声的减法

有声书是纯人声内容,码率可以做大幅减法:AAC 64kbps 或 MP3 96kbps 对人声完全够用——听感与 192kbps 无差别,体积差三倍。三小时的书按 64kbps AAC 算约 85MB,网盘与手机存储都友好。

格式选择:mp3 兼容面最广(老设备、车载都认),m4a/aac 体积更小、现代设备全支持。格式的完整选择逻辑在音频格式选择专题里有展开,纯人声场景取"够用就好"即可。

常见问题