视频转字幕:语音识别生成 SRT 的完整链路
课程录像要加字幕、访谈素材要出文稿、vlog 要发静音也能看的版本——这些需求的共同起点是"从视频里的语音生成字幕"。浏览器本地语音识别(Whisper)让这件事不必上传任何一个字节,链路分三段:识别前的准备、生成、校对。
两条产出路线
字幕路线:生成带时间轴的字幕文件(SRT/VTT),逐行对应画面,用于给视频配字幕或发布平台挂载。文稿路线:输出纯文本,用于整理笔记、归档检索、二次创作。同一个识别引擎,两种输出形态——先明确要哪条,校对重点不同(字幕看断句,文稿看通顺)。
两个工具对应两条路线:自动生成字幕(出 SRT/VTT)与视频转文字(出文稿),本地处理,视频文件直接可用(引擎内部先提取音轨)。
识别前的准备:音轨质量决定一切
识别准确率的头号变量是音轨质量:人声清晰、音量适中、底噪低的音频,准确率可达九成以上;嘈杂环境、人声重叠、音乐盖过人声的素材,准确率断崖下降。识别前先检查源音频:能降噪的先降噪(降噪会损失部分音质,但识别收益大于音质损失)、音量过小的先拉响度。
视频本身不是问题——引擎只听音轨。但混音里人声占比低的(MV、带大段 BGM 的 vlog),识别效果天然弱于口播类内容,预期要先摆正。
生成:时长与过程预期
本地识别速度与设备性能相关:现代笔记本处理一小时音频通常在几分钟到十几分钟量级(多线程设备更快),全程浏览器本地完成、视频不上传。长视频建议按章节分段处理——单段超长(两小时以上)的内存占用与出错重试成本都高。
生成过程无需值守:发起后等结果即可,进度条到头下载字幕文件。
校对:专有名词与断句
生成结果的必查三处:专有名词(人名、品牌、术语——识别引擎对生僻专名最弱,逐个替换)、标点与断句(自动断句偶尔把一句话切在奇怪的点,按语义手工调整)、数字与单位("三十分钟"与"30 分钟"的一致性)。文稿路线额外看通顺与口语化清理。
校对的省力技巧:先只校对字幕里"会被看见"的部分——字幕是观众直接阅读的内容,准确率要求高于文稿;文稿可放低到"语义可读"。
格式选择与挂载方式
字幕格式:SRT 最通用(播放器、平台、剪辑软件全认)、VTT 面向网页播放器、ASS 支持样式(字体、位置、特效)——格式差异与兼容性在字幕格式对比专题里有完整展开。拿不准就 SRT。
挂载方式两分:软字幕(字幕文件与视频一起交付,播放器加载,可开关)与硬字幕(烧进画面,任何环境都能看)——两种方式的取舍在加字幕的方式专题里有展开。平台发布通常直接上传 SRT 由平台挂载。
本地识别的隐私优势
访谈素材、内部培训、医疗法律内容——这类视频的语音往往敏感,云端识别等于把内容上传第三方。本地识别(Whisper 在浏览器内运行)全程视频不出设备,对隐私敏感场景是结构性优势。识别与校对的完整工作流建成后,字幕产出成本从"外包按分钟计费"降到"本地电费"。