产品推荐 2026-07-25

Speech-AI-Forge:免费的文本转语音工具

一个集成多种TTS模型的文本转语音工具,提供WebUI和API接口。

开源软件实用工具

产品简介

Speech-AI-Forge 是一个文本转语音工具,集成 ChatTTS、CosyVoice 等多种模型,提供基于 Gradio 的 WebUI 和 API Server,简化语音合成流程。适合需要高质量语音输出的开发者和内容创作者。

Speech-AI-Forge 主界面

核心功能

  • 多音色切换与自定义音色上传
  • 风格控制与速度、音调、音量调节
  • 长文本自动分割与批量推理
  • 支持多种 TTS 模型如 ChatTTS、CosyVoice、FishSpeech
  • 集成 ASR 语音识别与语音增强功能

快速开始

  1. 安装相关依赖(参考依赖文档)
  2. 使用下载脚本下载所需模型(如 `python -m scripts.download_models`)
  3. 运行 `python webui.py` 启动 WebUI 界面

界面预览

与其他方案对比

对比项Speech-AI-Forge同类方案
模型支持集成 ChatTTS、CosyVoice 等十多种 TTS 模型同类工具通常只支持少数几种模型
部署方式支持本地、Docker、Colab 等多种部署多为单一部署方式
用户界面提供基于 Gradio 的 WebUI,操作直观可能仅提供命令行或 API 接口

适合谁用

  • 需要生成播客或有声书的音频内容创作者
  • 集成语音合成到应用中的开发者
  • 进行语音识别和处理的研究人员

下载与版本

当前最新版本为 portable_v0.7,发布于 2026-02-02。支持 多平台。点击页面「下载软件」按钮即可下载打包好的版本,根据你的电脑/手机系统来选择对应的软件。

注意事项

  • 本工具仅供学习和研究使用,请遵守相关法律法规。
  • 请尊重内容创作者版权,勿将下载内容用于商业或非法传播。
  • 项目源码地址:https://github.com/lenML/Speech-AI-Forge