产品简介
stable-ts 这是一个基于 OpenAI Whisper 的开源工具库,旨在提供更稳定可靠的时间戳生成功能,并扩展了转录、对齐、编辑和索引等能力。适合需要精准语音转录和字幕制作的开发者、内容创作者和研究人员使用。

核心功能
- 提供比原版更精准可靠的语音时间戳
- 支持音频转录并生成 SRT/VTT 字幕文件
- 可对转录结果进行精细的单词级对齐与时间调整
- 提供静音抑制、词语重组等高级后处理功能
- 支持跨平台(Windows, macOS, Linux)与命令行调用
快速开始
- 安装前提:确保系统已安装 FFmpeg 和 PyTorch。
- 使用 pip 命令安装:`pip install -U stable-ts`。
- 通过 Python 代码加载模型并转录音频文件,或使用命令行 `stable-ts audio.mp3 -o audio.srt` 生成字幕。
界面预览


与其他方案对比
| 对比项 | stable-ts | 同类方案 |
|---|---|---|
| 时间戳准确性 | 通过内置算法优化,提供更稳定、可靠的时间戳。 | 原版 Whisper 生成的时间戳有时不够稳定或存在偏移。 |
| 功能扩展性 | 内置了对齐、重组、静音抑制、编辑等丰富的后处理功能。 | 原版 Whisper 功能主要集中在基础转录,后处理需要用户自行实现。 |
适合谁用
- 需要为视频/音频内容制作精准字幕的编辑或字幕组
- 从事语音识别、音频分析的研究人员或开发者
- 需要对会议录音、访谈等进行整理和索引的普通用户
下载与版本
当前最新版本为 2.0.0,发布于 2023-03-17。支持 Windows、macOS、Linux。
⚠️ 注意:本项目仅提供源代码下载,不包含可直接运行的安装包(exe/dmg/apk 等。下载后需要自行编译构建才能使用,适合有一定开发经验的用户。如果你不熟悉编译流程,建议寻找同类开箱即用的替代方案。
注意事项
- 本工具仅供学习和研究使用,请遵守相关法律法规。
- 请尊重内容创作者版权,勿将下载内容用于商业或非法传播。
- 项目源码地址:https://github.com/jianfch/stable-ts