产品简介
openedai-speech 这是一个开源的文本转语音服务器,兼容 OpenAI 的语音 API,允许用户在本地运行免费、私有的语音合成服务。它支持自定义语音克隆、多种输出格式和速度调节,无需 OpenAI API 密钥,适合需要本地部署语音合成的开发者和内容创作者。
核心功能
- 兼容 OpenAI 语音 API,提供标准音频生成端点
- 支持自定义语音克隆和多种预设声音如 alloy、echo 等
- 输出格式包括 mp3、opus、aac、flac、wav 等
- 语音速度可调范围 0.25 到 4.0 倍
- 支持多语言自动检测和流式输出
快速开始
- 第一步:复制 sample.env 为 speech.env 并根据需求配置环境变量
- 第二步:运行 `docker compose up`(NVIDIA GPU)或 `docker compose -f docker-compose.rocm.yml up`(AMD GPU)启动服务
- 第三步:首次启动时自动下载语音模型,之后可通过 API 调用生成语音
界面预览
与其他方案对比
| 对比项 | openedai-speech | 同类方案 |
|---|---|---|
| API 兼容性 | 完全兼容 OpenAI 语音 API,无需 API 密钥,本地运行 | 通常需要 OpenAI API 密钥,依赖云服务 |
| 语音自定义 | 支持自定义语音克隆和多种预设声音,可通过配置文件调整 | 多数仅提供预设声音,无克隆功能或自定义选项有限 |
| 部署方式 | 本地运行,支持 Docker 和手动安装,跨平台兼容 | 可能需复杂配置或仅限云服务,灵活性较低 |
适合谁用
- 需要本地部署语音合成服务的开发者
- 想要自定义声音进行内容创作的播客或视频制作者
- 寻求免费私有文本转语音解决方案的教育工作者或学生
下载与版本
当前最新版本为 0.18.2,发布于 2024-08-16。支持 Windows、macOS、Linux。
⚠️ 注意:本项目仅提供源代码下载,不包含可直接运行的安装包(exe/dmg/apk 等。下载后需要自行编译构建才能使用,适合有一定开发经验的用户。如果你不熟悉编译流程,建议寻找同类开箱即用的替代方案。
注意事项
- 本工具仅供学习和研究使用,请遵守相关法律法规。
- 请尊重内容创作者版权,勿将下载内容用于商业或非法传播。
- 项目源码地址:https://github.com/matatonic/openedai-speech