产品简介
CrisperWhisper 是一款先进的语音识别工具,它能将语音精准转录为两种文本:一种是包含所有语气词、重复等细节的「逐字稿」,另一种是提炼核心意图、格式规整的「意义稿」。它解决了传统语音转文字工具无法可靠记录口语细节的痛点,特别适合研究人员、内容创作者和开发者用于分析对话、构建训练数据或处理多语言内容。
核心功能
- 逐字转录模式:忠实记录所有口语细节,如“嗯”、“呃”、重复和笑声
- 意图转录模式:生成干净、易读、格式规范的文本
- 精确到词的时间戳:提供每个单词的开始和结束时间
- 升级现有转录(Verbatimize):为已有的干净文本插入音频中真实存在的口语细节
- 多语言支持:逐字与意图模式支持多种语言
快速开始
- 使用 pip 安装:`pip install "crisperwhisper[ct2]"` (GPU加速) 或 `pip install "crisperwhisper[transformers]"` (通用)。
- 在代码中导入并初始化模型:`from crisperwhisper import CrisperWhisperModel; model = CrisperWhisperModel()`。
- 调用转录功能:使用 `model.transcribe("音频文件", mode="verbatim")` 获取逐字稿,或 `mode="intended"` 获取意义稿。
界面预览
与其他方案对比
| 对比项 | CrisperWhisper | 同类方案 |
|---|---|---|
| 不流畅词(如‘嗯’、重复)识别准确率 (F1) | 领先,平均F1达87.8%,专业版达93.5% | 对比测试的其他主流系统均低于80%,如ElevenLabs为79.2%,Microsoft为77.5% |
| 单词级时间戳精度 | 领先,朗读语音平均边界误差仅29.6毫秒 | 对比测试的其他系统误差均大于37毫秒 |
适合谁用
- 需要精确分析对话语音细节(如口语研究、心理访谈)的研究人员
- 需要为语音合成(TTS)准备高保真带细节语料的数据科学家/开发者
- 需要处理多语言会议录音、生成规范文字记录的国际化团队
下载与版本
当前最新版本为 v2.0.1,发布于 2026-07-23。支持 Windows、macOS、Linux。
⚠️ 注意:本项目仅提供源代码下载,不包含可直接运行的安装包(exe/dmg/apk 等。下载后需要自行编译构建才能使用,适合有一定开发经验的用户。如果你不熟悉编译流程,建议寻找同类开箱即用的替代方案。
注意事项
- 本工具仅供学习和研究使用,请遵守相关法律法规。
- 请尊重内容创作者版权,勿将下载内容用于商业或非法传播。
- 项目源码地址:https://github.com/nyrahealth/CrisperWhisper