产品简介
GPA 集成 ASR、TTS 和语音转换功能,解决了需要多个独立模型处理音频任务的痛点,性能接近业界顶尖水平。支持 Windows、macOS 和 Linux,适合音频开发者、研究人员和需要高效音频处理的用户。

核心功能
- 统一模型集成 ASR、TTS、语音转换三大音频任务
- ASR 和 TTS 性能接近 SOTA 水平
- 支持多种部署方式,包括 PyTorch 和 ONNX Runtime
- 提供轻量级 TTS 运行时 GPA-TTS,适合边缘部署
- 开源模型在 Hugging Face 等平台可用
快速开始
- 下载程序:点击页面上的「下载软件」按钮获取。
- 运行程序:解压或安装后运行主程序。
- 开始使用:打开 GPA,按界面提示操作。
界面预览
与其他方案对比
| 对比项 | GPA | 同类方案 |
|---|---|---|
| 模型性能 | GPA-v1.5 在 TTS 测试中 CER 低、相似度高,接近人类水平 | 其他开源模型如 F5-TTS、CosyVoice2 性能较低 |
适合谁用
- 语音应用开发者
- 音频处理研究人员
- 需要高质量语音合成的内容创作者
下载与版本
当前最新版本为 main,发布于 。支持 Windows、macOS、Linux。
⚠️ 注意:本项目仅提供源代码下载,不包含可直接运行的安装包(exe/dmg/apk 等。下载后需要自行编译构建才能使用,适合有一定开发经验的用户。如果你不熟悉编译流程,建议寻找同类开箱即用的替代方案。
注意事项
- 本工具仅供学习和研究使用,请遵守相关法律法规。
- 请尊重内容创作者版权,勿将下载内容用于商业或非法传播。
- 项目源码地址:https://github.com/AutoArk/GPA