产品推荐 2026-07-26

WenetSpeech:免费的中文语音识别数据集(源码)

超过一万小时的中文语音识别开源数据集,用于语音识别研究。

开源软件跨平台工具

产品简介

WenetSpeech 是一个专为中文语音识别设计的大规模开源数据集,包含超过1万小时的多领域中文语音数据。它解决了研究者缺乏高质量、大规模中文语音数据用于模型训练和评估的痛点,适合语音识别领域的研究人员、工程师和开发者使用。

WenetSpeech 主界面

核心功能

  • 提供超过1万小时的高标注质量中文语音数据
  • 涵盖影视剧、新闻、有声书等10个领域
  • 提供S、M、L三种规模的训练子集
  • 包含设计良好的开发集与测试集
  • 数据通过端到端方法进行质量验证与过滤

快速开始

  1. 访问官网阅读许可协议,申请下载密码。
  2. 将申请到的密码写入SAFEBOX/password文件。
  3. 运行提供的脚本从腾讯会议或ModelScope下载并解压数据。

界面预览

WenetSpeech 界面截图

WenetSpeech 界面截图

与其他方案对比

对比项WenetSpeech同类方案
数据规模与质量提供超过1万小时高置信度标签数据,以及弱标签和无标签数据,总量超2.2万小时。部分公开数据集规模较小或领域单一。
基准测试表现使用本数据集训练的WeNet模型在多个测试集上达到有竞争力的字错率,例如在Test_Net上为9.70。使用其他工具(如Kaldi)在相同数据集上训练,Test_Net上字错率为12.83。

适合谁用

  • 进行中文语音识别算法研究的科研人员
  • 构建和优化中文ASR系统的工程师
  • 需要大规模中文语音数据进行模型预训练的开发者

下载与版本

当前最新版本为 main,发布于 。支持 Windows、macOS、Linux。

⚠️ 注意:本项目仅提供源代码下载,不包含可直接运行的安装包(exe/dmg/apk 等。下载后需要自行编译构建才能使用,适合有一定开发经验的用户。如果你不熟悉编译流程,建议寻找同类开箱即用的替代方案。

注意事项

  • 本工具仅供学习和研究使用,请遵守相关法律法规。
  • 请尊重内容创作者版权,勿将下载内容用于商业或非法传播。
  • 项目源码地址:https://github.com/wenet-e2e/WenetSpeech