视频转文字
识别视频或音频中的语音,输出纯文本;浏览器本地完成,无需上传。
模型与文件均不离开设备,识别精度以 Base 模型为推荐
完全免费
所有功能免费开放,不限制次数、时长与文件数量,导出无水印。
隐私安全
处理全程在你的浏览器本地完成,文件不会被上传到任何服务器。
在线预览
处理完成后直接在页面里预览效果,确认满意再下载保存。
在线工具
无需下载安装任何软件或插件,打开网页即可使用,手机电脑都支持。
简单易用
界面直观、步骤清晰,不需要任何专业的视频编辑经验。
格式支持丰富
覆盖 MP4、MOV、MKV、WebM、AVI 等常见封装与编码,少见格式也能处理。
为什么要视频转文字
识别视频或音频中的语音,输出纯文本;浏览器本地完成,无需上传。
处理链路:本地 FFmpeg 提取音轨并转为 16kHz 单声道,解码后由 Whisper 模型按 30 秒分块推理,生成带时间戳的文本。识别语言可指定中/英/日/韩/西/法/德,或由模型自动检测。
Tiny 模型(约 40MB)速度优先,Base(约 78MB)对中文与英文识别更稳。模型权重首次使用下载一次,之后由浏览器缓存;推理速度约为实时的 1/4 到 1 倍。
转录基于 OpenAI Whisper 模型的 ONNX 移植版,在浏览器内通过 WebAssembly 推理:先由本地 FFmpeg 提取 16kHz 单声道音频,再按 30 秒分块送入模型生成带时间戳的文本。模型与音视频数据均不离开设备,首次使用需下载模型权重(tiny 约 40MB,base 约 78MB)。
处理全程在浏览器本地完成,文件不上传服务器。
如何在线使用视频转文字
有疑问?查看常见问题
点击选择或拖入本地文件,文件不上传服务器。
按需调整选项,默认值适用于大多数场景。
处理在浏览器本地完成,首次使用需加载处理引擎。
处理完成后可在线预览,确认后保存到设备。
常见问题
准备好使用视频转文字了吗?
无需注册、免费无水印,全程在你的浏览器本地完成。