产品推荐 2026-07-25

VoiceStreamAI:免费的近实时音频转录工具(源码)

基于 Whisper 和 WebSocket 的近实时音频转录自托管工具。

开源软件跨平台工具

产品简介

VoiceStreamAI 是一个开源近实时音频转录系统,通过 WebSocket 流式传输音频并使用 Whisper 模型进行语音识别,支持多语言和自托管部署。适合需要实时处理语音内容的开发者和团队,解决音频数据实时转录的痛点。

核心功能

  • 实时音频流通过 WebSocket 传输
  • 模块化设计便于集成不同 VAD 和 ASR 技术
  • 灵活组件管理(工厂和策略模式)
  • 支持多语言转录
  • 可选安全套接字连接

快速开始

  1. 安装 Python 3.8+ 并运行 `pip install -r requirements.txt` 安装依赖。
  2. 从 Huggingface 页面获取 VAD 模型的认证令牌。
  3. 运行服务器命令:`python3 -m src.main --vad-args '{"auth_token": "your_token"}'`。
  4. 在浏览器中打开 `client/index.html` 文件。
  5. 输入 WebSocket 地址(默认 `ws://localhost:8765`)并点击连接,开始音频流。

界面预览

与其他方案对比

对比项VoiceStreamAI同类方案
部署方式自托管,保护数据隐私依赖云服务,可能涉及隐私风险
实时性能使用 WebSocket 实现近实时转录传统转录工具延迟较高
技术集成模块化设计,易于扩展和定制可能使用固定技术栈,灵活性低

适合谁用

  • 需要实时语音识别的开发者
  • 进行音频内容分析的科研人员
  • 想要自托管语音识别服务的企业用户

下载与版本

当前最新版本为 main,发布于 。支持 Windows、macOS、Linux。

⚠️ 注意:本项目仅提供源代码下载,不包含可直接运行的安装包(exe/dmg/apk 等。下载后需要自行编译构建才能使用,适合有一定开发经验的用户。如果你不熟悉编译流程,建议寻找同类开箱即用的替代方案。

注意事项

  • 本工具仅供学习和研究使用,请遵守相关法律法规。
  • 请尊重内容创作者版权,勿将下载内容用于商业或非法传播。
  • 项目源码地址:https://github.com/alesaccoia/VoiceStreamAI