产品推荐 2026-07-25

stable-ts:免费的语音转文字与精准对齐工具(源码)

stable-ts 这是一个基于 OpenAI Whisper 的开源工具库,旨在提供更稳定可靠的时间戳生成功能,并扩展了转录、对齐、编辑和索引等能力。

开源软件跨平台工具

产品简介

stable-ts 这是一个基于 OpenAI Whisper 的开源工具库,旨在提供更稳定可靠的时间戳生成功能,并扩展了转录、对齐、编辑和索引等能力。适合需要精准语音转录和字幕制作的开发者、内容创作者和研究人员使用。

stable-ts 主界面

核心功能

  • 提供比原版更精准可靠的语音时间戳
  • 支持音频转录并生成 SRT/VTT 字幕文件
  • 可对转录结果进行精细的单词级对齐与时间调整
  • 提供静音抑制、词语重组等高级后处理功能
  • 支持跨平台(Windows, macOS, Linux)与命令行调用

快速开始

  1. 安装前提:确保系统已安装 FFmpeg 和 PyTorch。
  2. 使用 pip 命令安装:`pip install -U stable-ts`。
  3. 通过 Python 代码加载模型并转录音频文件,或使用命令行 `stable-ts audio.mp3 -o audio.srt` 生成字幕。

界面预览

stable-ts 界面截图

stable-ts 界面截图

与其他方案对比

对比项stable-ts同类方案
时间戳准确性通过内置算法优化,提供更稳定、可靠的时间戳。原版 Whisper 生成的时间戳有时不够稳定或存在偏移。
功能扩展性内置了对齐、重组、静音抑制、编辑等丰富的后处理功能。原版 Whisper 功能主要集中在基础转录,后处理需要用户自行实现。

适合谁用

  • 需要为视频/音频内容制作精准字幕的编辑或字幕组
  • 从事语音识别、音频分析的研究人员或开发者
  • 需要对会议录音、访谈等进行整理和索引的普通用户

下载与版本

当前最新版本为 2.0.0,发布于 2023-03-17。支持 Windows、macOS、Linux。

⚠️ 注意:本项目仅提供源代码下载,不包含可直接运行的安装包(exe/dmg/apk 等。下载后需要自行编译构建才能使用,适合有一定开发经验的用户。如果你不熟悉编译流程,建议寻找同类开箱即用的替代方案。

注意事项

  • 本工具仅供学习和研究使用,请遵守相关法律法规。
  • 请尊重内容创作者版权,勿将下载内容用于商业或非法传播。
  • 项目源码地址:https://github.com/jianfch/stable-ts