产品简介
VoiceStreamAI 是一个开源近实时音频转录系统,通过 WebSocket 流式传输音频并使用 Whisper 模型进行语音识别,支持多语言和自托管部署。适合需要实时处理语音内容的开发者和团队,解决音频数据实时转录的痛点。
核心功能
- 实时音频流通过 WebSocket 传输
- 模块化设计便于集成不同 VAD 和 ASR 技术
- 灵活组件管理(工厂和策略模式)
- 支持多语言转录
- 可选安全套接字连接
快速开始
- 安装 Python 3.8+ 并运行 `pip install -r requirements.txt` 安装依赖。
- 从 Huggingface 页面获取 VAD 模型的认证令牌。
- 运行服务器命令:`python3 -m src.main --vad-args '{"auth_token": "your_token"}'`。
- 在浏览器中打开 `client/index.html` 文件。
- 输入 WebSocket 地址(默认 `ws://localhost:8765`)并点击连接,开始音频流。
界面预览
与其他方案对比
| 对比项 | VoiceStreamAI | 同类方案 |
|---|---|---|
| 部署方式 | 自托管,保护数据隐私 | 依赖云服务,可能涉及隐私风险 |
| 实时性能 | 使用 WebSocket 实现近实时转录 | 传统转录工具延迟较高 |
| 技术集成 | 模块化设计,易于扩展和定制 | 可能使用固定技术栈,灵活性低 |
适合谁用
- 需要实时语音识别的开发者
- 进行音频内容分析的科研人员
- 想要自托管语音识别服务的企业用户
下载与版本
当前最新版本为 main,发布于 。支持 Windows、macOS、Linux。
⚠️ 注意:本项目仅提供源代码下载,不包含可直接运行的安装包(exe/dmg/apk 等。下载后需要自行编译构建才能使用,适合有一定开发经验的用户。如果你不熟悉编译流程,建议寻找同类开箱即用的替代方案。
注意事项
- 本工具仅供学习和研究使用,请遵守相关法律法规。
- 请尊重内容创作者版权,勿将下载内容用于商业或非法传播。
- 项目源码地址:https://github.com/alesaccoia/VoiceStreamAI