跳转到主要内容
工作流6 分钟

会议纪要:录音转文字并导出文稿的本地做法

会议录音在浏览器本地完成语音识别:Whisper 模型下载到设备后推理,音频文件与识别结果都不上传服务器。1 小时的清晰人声录音,转录加人工校对,通常 30-40 分钟可以出一份可用纪要。

本地转录适合对内容保密有要求的场景(内部会议、访谈、课程)。首次使用需下载约 100MB 的模型文件,之后离线可用。

本地转录与在线服务的区别

在线转写服务要求把录音上传到厂商服务器,按分钟计费且有隐私让渡;本地转录的模型在浏览器内运行,音频不出设备,不限时长、不限次数、不收费。

代价是首次要下载模型文件(约 100MB),且转录速度取决于设备性能:1 小时录音在主流笔记本上约 10-20 分钟完成,期间页面保持前台即可。

工作流:录音到纪要三步

第一步转录:把录音文件(MP3/M4A/WAV 均可)交给 auto-subtitle,输出带时间轴的 SRT 字幕;只要纯文字不要时间轴时用 video-to-text 直接出文稿。

第二步校对:按时间轴回听疑难点,修正人名、专业术语与数字——这三类是语音识别的主要错误来源。带时间轴的 SRT 让回听定位精确到句。

第三步整理:把校对后的文稿按议题分段,删去语气词与重复表述,提炼决议与待办。

大录音文件先压缩再转录

手机录音 1 小时约 50-100MB,无损 WAV 可达 500MB 以上。转录只需要可懂度,不需要音质:先把录音压到 64kbps 单声道,体积降一个数量级,加载与解码时间同步缩短。

超过 2 小时的超长录音建议先按议题切成 30-60 分钟的段再分别转录:单次处理更快,校对时的上下文也更聚焦。

影响准确率的因素

因素影响改善办法
录音清晰度最大因素录音设备靠近发言人,减少环境噪声
多人交叉发言重叠部分识别率下降会议约定轮流发言;重叠段人工补记
专业术语/人名易识别为同音错字校对阶段全局替换纠正
方言与口音普通话以外准确率下降口音重的段落放慢回听核对

清晰单人朗读的中文音频识别准确率可达 90% 以上;会议室远场录音实际通常在 70-85%,校对环节不可省。

常见问题