产品简介
Speech-AI-Forge 是一个文本转语音工具,集成 ChatTTS、CosyVoice 等多种模型,提供基于 Gradio 的 WebUI 和 API Server,简化语音合成流程。适合需要高质量语音输出的开发者和内容创作者。

核心功能
- 多音色切换与自定义音色上传
- 风格控制与速度、音调、音量调节
- 长文本自动分割与批量推理
- 支持多种 TTS 模型如 ChatTTS、CosyVoice、FishSpeech
- 集成 ASR 语音识别与语音增强功能
快速开始
- 安装相关依赖(参考依赖文档)
- 使用下载脚本下载所需模型(如 `python -m scripts.download_models`)
- 运行 `python webui.py` 启动 WebUI 界面
界面预览
与其他方案对比
| 对比项 | Speech-AI-Forge | 同类方案 |
|---|---|---|
| 模型支持 | 集成 ChatTTS、CosyVoice 等十多种 TTS 模型 | 同类工具通常只支持少数几种模型 |
| 部署方式 | 支持本地、Docker、Colab 等多种部署 | 多为单一部署方式 |
| 用户界面 | 提供基于 Gradio 的 WebUI,操作直观 | 可能仅提供命令行或 API 接口 |
适合谁用
- 需要生成播客或有声书的音频内容创作者
- 集成语音合成到应用中的开发者
- 进行语音识别和处理的研究人员
下载与版本
当前最新版本为 portable_v0.7,发布于 2026-02-02。支持 多平台。点击页面「下载软件」按钮即可下载打包好的版本,根据你的电脑/手机系统来选择对应的软件。
注意事项
- 本工具仅供学习和研究使用,请遵守相关法律法规。
- 请尊重内容创作者版权,勿将下载内容用于商业或非法传播。
- 项目源码地址:https://github.com/lenML/Speech-AI-Forge