产品简介
VoxCPM 2 是一款先进的文本转语音工具,无需离散化步骤即可直接生成高度自然且富有表现力的语音。它支持 30 种语言及多种中文方言,能通过文字描述创建全新声音,或从短音频中克隆声音并控制风格。适合需要高质量多语言语音合成、个性化声音创建及声音克隆的内容创作者、开发者和音频制作者。

核心功能
- 支持 30 种语言和多种中文方言
- 无需参考音频,通过文字描述设计全新声音
- 从短参考音频克隆声音,并可控制情感、语速等风格
- 输出 48kHz 专业级高保真音频
- 支持实时流式合成,降低延迟
快速开始
- 安装 Python 3.10+ 环境,并配置 PyTorch 与 CUDA。
- 通过 pip install voxcpm 安装工具包。
- 在 Python 代码中加载模型并调用 generate 函数,输入文本即可生成音频。
界面预览


与其他方案对比
| 对比项 | VoxCPM | 同类方案 |
|---|---|---|
| 技术架构 | 采用无分词器的端到端扩散自回归架构,直接生成连续语音 | 多数传统TTS系统依赖离散化语音Token,可能损失自然度 |
| 声音克隆要求 | 支持从短参考音频克隆,并可使用文字描述控制风格 | 部分方案需要较长参考音频或无法精细控制生成风格 |
适合谁用
- 需要为短视频或播客进行多语言配音的内容创作者
- 需要为产品添加个性化语音交互的开发者
- 需要克隆特定声音用于有声读物或广告的音频制作者
下载与版本
当前最新版本为 2.0.3,发布于 2026-05-11。支持 Windows、macOS、Linux。
⚠️ 注意:本项目仅提供源代码下载,不包含可直接运行的安装包(exe/dmg/apk 等。下载后需要自行编译构建才能使用,适合有一定开发经验的用户。如果你不熟悉编译流程,建议寻找同类开箱即用的替代方案。
注意事项
- 本工具仅供学习和研究使用,请遵守相关法律法规。
- 请尊重内容创作者版权,勿将下载内容用于商业或非法传播。
- 项目源码地址:https://github.com/OpenBMB/VoxCPM