工作流 约 6 分钟
会议纪要:录音转文字并导出文稿的本地做法
会议录音在浏览器本地完成语音识别:Whisper 模型下载到设备后推理,音频文件与识别结果都不上传服务器。1 小时的清晰人声录音,转录加人工校对,通常 30-40 分钟可以出一份可用纪要。
本地转录适合对内容保密有要求的场景(内部会议、访谈、课程)。首次使用需下载约 100MB 的模型文件,之后离线可用。
本地转录与在线服务的区别
在线转写服务要求把录音上传到厂商服务器,按分钟计费且有隐私让渡;本地转录的模型在浏览器内运行,音频不出设备,不限时长、不限次数、不收费。
代价是首次要下载模型文件(约 100MB),且转录速度取决于设备性能:1 小时录音在主流笔记本上约 10-20 分钟完成,期间页面保持前台即可。
工作流:录音到纪要三步
第一步转录:把录音文件(MP3/M4A/WAV 均可)交给 auto-subtitle,输出带时间轴的 SRT 字幕;只要纯文字不要时间轴时用 video-to-text 直接出文稿。
第二步校对:按时间轴回听疑难点,修正人名、专业术语与数字——这三类是语音识别的主要错误来源。带时间轴的 SRT 让回听定位精确到句。
第三步整理:把校对后的文稿按议题分段,删去语气词与重复表述,提炼决议与待办。
大录音文件先压缩再转录
手机录音 1 小时约 50-100MB,无损 WAV 可达 500MB 以上。转录只需要可懂度,不需要音质:先把录音压到 64kbps 单声道,体积降一个数量级,加载与解码时间同步缩短。
超过 2 小时的超长录音建议先按议题切成 30-60 分钟的段再分别转录:单次处理更快,校对时的上下文也更聚焦。
影响准确率的因素
| 因素 | 影响 | 改善办法 |
|---|---|---|
| 录音清晰度 | 最大因素 | 录音设备靠近发言人,减少环境噪声 |
| 多人交叉发言 | 重叠部分识别率下降 | 会议约定轮流发言;重叠段人工补记 |
| 专业术语/人名 | 易识别为同音错字 | 校对阶段全局替换纠正 |
| 方言与口音 | 普通话以外准确率下降 | 口音重的段落放慢回听核对 |
清晰单人朗读的中文音频识别准确率可达 90% 以上;会议室远场录音实际通常在 70-85%,校对环节不可省。