产品推荐 2026-07-21

stt:离线运行本地部署的音视频字幕识别工具

一个离线本地音视频转字幕工具,支持json、srt、纯文字输出。

开源软件实用工具

产品简介

stt 基于fast-whisper开源模型的离线音视频转字幕工具,能准确识别多种语言人声并转换为文字,输出json、srt或纯文本格式。适合需要本地部署、替代在线API的开发者和内容创作者,注重数据隐私和离线处理。

stt 主界面

核心功能

  • 离线本地运行,无需依赖网络
  • 支持多种模型大小(tiny到large-v3)
  • 输出json、srt字幕、纯文字格式
  • 提供API接口兼容OpenAI格式
  • 支持CUDA加速提升处理速度

快速开始

  1. 从GitHub Releases页面下载预编译文件并解压到本地目录
  2. 双击start.exe启动工具,等待自动打开浏览器窗口
  3. 上传音视频文件,选择语言、模型和输出格式
  4. 点击“立即开始识别”按钮,在文本框中查看结果

界面预览

stt 界面截图

stt 界面截图

与其他方案对比

对比项stt同类方案
部署方式本地离线运行,无需网络依赖在线API服务如OpenAI或百度,需要网络连接
数据隐私数据本地处理,不上传云端数据上传到第三方服务器,存在隐私风险
准确率基本等同OpenAI官方API准确率在线服务准确率受网络延迟和模型限制影响

适合谁用

  • 需要为视频添加字幕的视频编辑者
  • 希望本地部署语音识别API的软件开发者
  • 处理多语言音音频内容的翻译工作者
  • 注重数据隐私、需要离线处理的企业用户

下载与版本

当前最新版本为 20250805,发布于 2025-08-05。支持 多平台。点击页面「下载软件」按钮即可下载打包好的版本,根据你的电脑/手机系统来选择对应的软件。

注意事项

  • 本工具仅供学习和研究使用,请遵守相关法律法规。
  • 请尊重内容创作者版权,勿将下载内容用于商业或非法传播。
  • 项目源码地址:https://github.com/jianchang512/stt