产品简介
CosyVoice 是一个基于大语言模型的先进文本转语音系统,支持9种语言和18+中文方言,实现零样本语音克隆,提供发音修正、低延迟流式输出,适合开发者、研究人员和内容创作者用于语音合成应用。

核心功能
- 多语言覆盖:支持9种常用语言及18+中文方言,零样本语音克隆。
- 高自然度:在内容一致性、说话人相似度和韵律自然性上领先。
- 发音可控:支持拼音和英语音素修正,增强生产可用性。
- 文本规范化:无需传统前端,直接读取数字、符号和多格式文本。
- 低延迟流:支持双向流,延迟低至150ms,保持高质量输出。
快速开始
- 克隆仓库并安装子模块:运行 git clone 和 git submodule update。
- 创建 Conda 环境并安装依赖:创建 Python 3.10 环境并 pip install requirements。
- 下载预训练模型:使用 modelscope 或 huggingface SDK 下载模型文件。
- 运行示例代码:执行 python example.py 体验基本功能。
界面预览

与其他方案对比
| 对比项 | CosyVoice | 同类方案 |
|---|---|---|
| 中文说话人相似度 (SS) | Fun-CosyVoice3 SS 78.0% | F5-TTS SS 74.1%, Spark TTS SS 66.0% |
| 中文内容一致性 (CER) | Fun-CosyVoice3 CER 1.21% | F5-TTS CER 1.52%, Spark TTS CER 1.2% |
适合谁用
- 需要多语言语音合成的应用开发者。
- 研究语音生成模型的研究人员和学生。
- 制作有声读物、视频配音等内容创作者。
下载与版本
当前最新版本为 main,发布于 。支持 Windows、macOS、Linux。
⚠️ 注意:本项目仅提供源代码下载,不包含可直接运行的安装包(exe/dmg/apk 等。下载后需要自行编译构建才能使用,适合有一定开发经验的用户。如果你不熟悉编译流程,建议寻找同类开箱即用的替代方案。
注意事项
- 本工具仅供学习和研究使用,请遵守相关法律法规。
- 请尊重内容创作者版权,勿将下载内容用于商业或非法传播。
- 项目源码地址:https://github.com/FunAudioLLM/CosyVoice