产品简介
ffvoice-engine 是一个开源离线语音识别和说话人分离引擎,基于Whisper ASR,100%本地运行,无需网络,保护隐私,零API费用。适合开发者集成到AI应用,用于会议记录、直播字幕、教育内容等场景,实现低延迟音频处理。

核心功能
- 实时音频采集与RNNoise降噪
- 离线语音识别(Whisper ASR,支持多种输出格式)
- 实时字幕流生成
- 说话人分离与标注
- AI Agent集成(CLI + MCP server)
快速开始
- 安装依赖(如CMake、FFmpeg、PortAudio,参考平台命令)
- 通过pip安装ffvoice或从源码构建
- 运行Python示例或CLI命令开始语音识别
界面预览
与其他方案对比
| 对比项 | ffvoice-engine | 同类方案 |
|---|---|---|
| 隐私保护 | 100%离线,音频不上云 | 云端服务需上传音频,有隐私风险 |
| 成本 | 零per-minute费用,本地运行 | 商业API按分钟收费(如$0.01-0.024/min) |
| 集成难度 | 开箱即用管道,一键安装 | 需自行拼接PortAudio、RNNoise、Whisper等组件 |
适合谁用
- 需要实时会议记录和说话人标注的职场人士
- 制作在线课程并生成字幕的教育工作者
- 开发本地语音助手或AI Agent的开发者
- 播客制作者和直播主播
下载与版本
当前最新版本为 v0.8.3,发布于 2026-05-19。支持 Linux。点击页面「下载软件」按钮即可下载打包好的版本,根据你的电脑/手机系统来选择对应的软件。
注意事项
- 本工具仅供学习和研究使用,请遵守相关法律法规。
- 请尊重内容创作者版权,勿将下载内容用于商业或非法传播。
- 项目源码地址:https://github.com/chicogong/ffvoice-engine