产品简介
stt 基于fast-whisper开源模型的离线音视频转字幕工具,能准确识别多种语言人声并转换为文字,输出json、srt或纯文本格式。适合需要本地部署、替代在线API的开发者和内容创作者,注重数据隐私和离线处理。

核心功能
- 离线本地运行,无需依赖网络
- 支持多种模型大小(tiny到large-v3)
- 输出json、srt字幕、纯文字格式
- 提供API接口兼容OpenAI格式
- 支持CUDA加速提升处理速度
快速开始
- 从GitHub Releases页面下载预编译文件并解压到本地目录
- 双击start.exe启动工具,等待自动打开浏览器窗口
- 上传音视频文件,选择语言、模型和输出格式
- 点击“立即开始识别”按钮,在文本框中查看结果
界面预览


与其他方案对比
| 对比项 | stt | 同类方案 |
|---|---|---|
| 部署方式 | 本地离线运行,无需网络 | 依赖在线API服务如OpenAI或百度,需要网络连接 |
| 数据隐私 | 数据本地处理,不上传云端 | 数据上传到第三方服务器,存在隐私风险 |
| 准确率 | 基本等同OpenAI官方API准确率 | 在线服务准确率受网络延迟和模型限制影响 |
适合谁用
- 需要为视频添加字幕的视频编辑者
- 希望本地部署语音识别API的软件开发者
- 处理多语言音音频内容的翻译工作者
- 注重数据隐私、需要离线处理的企业用户
下载与版本
当前最新版本为 20250805,发布于 2025-08-05。支持 多平台。点击页面「下载软件」按钮即可下载打包好的版本,根据你的电脑/手机系统来选择对应的软件。
注意事项
- 本工具仅供学习和研究使用,请遵守相关法律法规。
- 请尊重内容创作者版权,勿将下载内容用于商业或非法传播。
- 项目源码地址:https://github.com/jianchang512/stt