产品推荐 2026-07-25

openedai-speech:文本转语音服务器软件(源码)

开源文本转语音服务器,兼容 OpenAI API,支持自定义语音克隆。

开源软件跨平台工具

产品简介

openedai-speech 这是一个开源的文本转语音服务器,兼容 OpenAI 的语音 API,允许用户在本地运行免费、私有的语音合成服务。它支持自定义语音克隆、多种输出格式和速度调节,无需 OpenAI API 密钥,适合需要本地部署语音合成的开发者和内容创作者。

核心功能

  • 兼容 OpenAI 语音 API,提供标准音频生成端点
  • 支持自定义语音克隆和多种预设声音如 alloy、echo 等
  • 输出格式包括 mp3、opus、aac、flac、wav 等
  • 语音速度可调范围 0.25 到 4.0 倍
  • 支持多语言自动检测和流式输出

快速开始

  1. 第一步:复制 sample.env 为 speech.env 并根据需求配置环境变量
  2. 第二步:运行 `docker compose up`(NVIDIA GPU)或 `docker compose -f docker-compose.rocm.yml up`(AMD GPU)启动服务
  3. 第三步:首次启动时自动下载语音模型,之后可通过 API 调用生成语音

界面预览

与其他方案对比

对比项openedai-speech同类方案
API 兼容性完全兼容 OpenAI 语音 API,无需 API 密钥,本地运行通常需要 OpenAI API 密钥,依赖云服务
语音自定义支持自定义语音克隆和多种预设声音,可通过配置文件调整多数仅提供预设声音,无克隆功能或自定义选项有限
部署方式本地运行,支持 Docker 和手动安装,跨平台兼容可能需复杂配置或仅限云服务,灵活性较低

适合谁用

  • 需要本地部署语音合成服务的开发者
  • 想要自定义声音进行内容创作的播客或视频制作者
  • 寻求免费私有文本转语音解决方案的教育工作者或学生

下载与版本

当前最新版本为 0.18.2,发布于 2024-08-16。支持 Windows、macOS、Linux。

⚠️ 注意:本项目仅提供源代码下载,不包含可直接运行的安装包(exe/dmg/apk 等。下载后需要自行编译构建才能使用,适合有一定开发经验的用户。如果你不熟悉编译流程,建议寻找同类开箱即用的替代方案。

注意事项