产品推荐 2026-07-24

CosyVoice:开源免费多语言支持的语音合成工具(源码)

CosyVoice 是一个多语言语音生成大模型,支持文本转语音的推理、训练和部署。

开源软件跨平台工具

产品简介

CosyVoice 是一个基于大语言模型的先进文本转语音系统,支持9种语言和18+中文方言,实现零样本语音克隆,提供发音修正、低延迟流式输出,适合开发者、研究人员和内容创作者用于语音合成应用。

CosyVoice 主界面

核心功能

  • 多语言覆盖:支持9种常用语言及18+中文方言,零样本语音克隆。
  • 高自然度:在内容一致性、说话人相似度和韵律自然性上领先。
  • 发音可控:支持拼音和英语音素修正,增强生产可用性。
  • 文本规范化:无需传统前端,直接读取数字、符号和多格式文本。
  • 低延迟流:支持双向流,延迟低至150ms,保持高质量输出。

快速开始

  1. 克隆仓库并安装子模块:运行 git clone 和 git submodule update。
  2. 创建 Conda 环境并安装依赖:创建 Python 3.10 环境并 pip install requirements。
  3. 下载预训练模型:使用 modelscope 或 huggingface SDK 下载模型文件。
  4. 运行示例代码:执行 python example.py 体验基本功能。

界面预览

CosyVoice 界面截图

与其他方案对比

对比项CosyVoice同类方案
中文说话人相似度 (SS)Fun-CosyVoice3 SS 78.0%F5-TTS SS 74.1%, Spark TTS SS 66.0%
中文内容一致性 (CER)Fun-CosyVoice3 CER 1.21%F5-TTS CER 1.52%, Spark TTS CER 1.2%

适合谁用

  • 需要多语言语音合成的应用开发者。
  • 研究语音生成模型的研究人员和学生。
  • 制作有声读物、视频配音等内容创作者。

下载与版本

当前最新版本为 main,发布于 。支持 Windows、macOS、Linux。

⚠️ 注意:本项目仅提供源代码下载,不包含可直接运行的安装包(exe/dmg/apk 等。下载后需要自行编译构建才能使用,适合有一定开发经验的用户。如果你不熟悉编译流程,建议寻找同类开箱即用的替代方案。

注意事项

  • 本工具仅供学习和研究使用,请遵守相关法律法规。
  • 请尊重内容创作者版权,勿将下载内容用于商业或非法传播。
  • 项目源码地址:https://github.com/FunAudioLLM/CosyVoice