产品简介
RealtimeSTT 是一个Python库,用于实现实时语音转文本,支持语音活动检测、唤醒词激活和即时转录。它解决了语音识别集成复杂、延迟高的问题,适合需要快速转录功能的助手、听写工具或浏览器流服务器开发者。
核心功能
- 语音活动检测(WebRTC和Silero VAD)
- 支持最终和实时转录,可选多种引擎
- 可选的唤醒词激活(Porcupine或OpenWakeWord)
- 直接麦克风输入或外部音频喂入
- 事件回调和FastAPI浏览器流服务器示例
快速开始
- 安装Python 3.11或更新版本
- 使用pip安装"RealtimeSTT[faster-whisper]"
- 在代码中导入AudioToTextRecorder并调用text()方法获取转录
界面预览
与其他方案对比
| 对比项 | RealtimeSTT | 同类方案 |
|---|---|---|
| 延迟表现 | 低延迟,支持实时转录,适合即时应用 | 可能延迟较高,需要云端处理 |
| 本地支持 | 支持本地引擎如Kroko,无需云端依赖 | 可能主要依赖云端服务,隐私和成本问题 |
适合谁用
- 需要构建语音助手的开发者
- 制作听写或笔记应用的工程师
- 开发浏览器实时转录服务的技术人员
下载与版本
当前最新版本为 v1.0.2,发布于 2026-05-31。支持 Windows、macOS、Linux。点击页面「下载软件」按钮即可下载打包好的版本,根据你的电脑/手机系统来选择对应的软件。
注意事项
- 本工具仅供学习和研究使用,请遵守相关法律法规。
- 请尊重内容创作者版权,勿将下载内容用于商业或非法传播。
- 项目源码地址:https://github.com/KoljaB/RealtimeSTT