工作流 约 5 分钟
采访录音转文字:从录音到整理稿的流程
一小时的采访录音,逐句回听打字要一下午。语音识别把这压缩到二十分钟校对——前提是流程走对:录音预处理、识别引擎、校对整理,每一步都有省时的做法。
链路总览:预处理、识别、校对
第一步预处理:录音文件若是视频里的音轨,先抽成音频;长录音先过一遍剪掉明显的空白与闲聊段——识别引擎按时间算效率,垃圾段少了校对量也少。格式统一到标准 PCM WAV 或高质量 MP3,识别效果最稳。
第二步识别:本地语音识别跑一遍出初稿。第三步校对:对稿回听,只听识别不确定的地方——专有名词、数字、重叠说话的段落。全程数据在本机,未发布的采访素材不出设备,这是云端转写给不了的安心。
识别前的音频预处理
音质决定准确率上限。底噪重的录音先降噪——信噪比上去了,专有名词的识别错误率明显下降。多人对话的采访,说话人重叠是识别重灾区:录音时尽量引导受访者等一下再接话,比任何后期手段都有效。
音量归一:忽大忽小的录音,小声段的识别最容易丢字。压缩或归一处理把音量拉平再识别。长录音按话题切段(每段 10 到 20 分钟),识别与校对都以段为单位推进,进度可控。
校对与整理的纪律
校对不是逐字回听——识别稿整体读一遍,标记不通顺的句子,只对标记处回听原录音。专有名词建立一张替换表(人名、机构名、术语),全文替换一次,比逐处修改快得多。
整理稿的口径提前定:逐字稿(含语气词,法律或研究用途)还是编辑稿(可删冗余,媒体用途)。时间戳别删——保留段落级时间锚点,后续引用与回查都靠它。