产品推荐 2026-07-25

CrisperWhisper:免费的逐字语音识别工具(源码)

一款精准的逐字语音识别工具,能区分并转录‘说了什么’与‘想说什么’。

开源软件跨平台工具

产品简介

CrisperWhisper 是一款先进的语音识别工具,它能将语音精准转录为两种文本:一种是包含所有语气词、重复等细节的「逐字稿」,另一种是提炼核心意图、格式规整的「意义稿」。它解决了传统语音转文字工具无法可靠记录口语细节的痛点,特别适合研究人员、内容创作者和开发者用于分析对话、构建训练数据或处理多语言内容。

核心功能

  • 逐字转录模式:忠实记录所有口语细节,如“嗯”、“呃”、重复和笑声
  • 意图转录模式:生成干净、易读、格式规范的文本
  • 精确到词的时间戳:提供每个单词的开始和结束时间
  • 升级现有转录(Verbatimize):为已有的干净文本插入音频中真实存在的口语细节
  • 多语言支持:逐字与意图模式支持多种语言

快速开始

  1. 使用 pip 安装:`pip install "crisperwhisper[ct2]"` (GPU加速) 或 `pip install "crisperwhisper[transformers]"` (通用)。
  2. 在代码中导入并初始化模型:`from crisperwhisper import CrisperWhisperModel; model = CrisperWhisperModel()`。
  3. 调用转录功能:使用 `model.transcribe("音频文件", mode="verbatim")` 获取逐字稿,或 `mode="intended"` 获取意义稿。

界面预览

与其他方案对比

对比项CrisperWhisper同类方案
不流畅词(如‘嗯’、重复)识别准确率 (F1)领先,平均F1达87.8%,专业版达93.5%对比测试的其他主流系统均低于80%,如ElevenLabs为79.2%,Microsoft为77.5%
单词级时间戳精度领先,朗读语音平均边界误差仅29.6毫秒对比测试的其他系统误差均大于37毫秒

适合谁用

  • 需要精确分析对话语音细节(如口语研究、心理访谈)的研究人员
  • 需要为语音合成(TTS)准备高保真带细节语料的数据科学家/开发者
  • 需要处理多语言会议录音、生成规范文字记录的国际化团队

下载与版本

当前最新版本为 v2.0.1,发布于 2026-07-23。支持 Windows、macOS、Linux。

⚠️ 注意:本项目仅提供源代码下载,不包含可直接运行的安装包(exe/dmg/apk 等。下载后需要自行编译构建才能使用,适合有一定开发经验的用户。如果你不熟悉编译流程,建议寻找同类开箱即用的替代方案。

注意事项