产品简介
AudioToText 是基于 OpenAI Whisper 和 DeepL 的音频转录与翻译工具,可自动将音频文件转换为文本并支持多语言翻译。支持生成字幕文件(如 VTT、SRT),适合需要处理音频内容、制作字幕或进行跨语言翻译的内容创作者和翻译人员。
核心功能
- 使用 Whisper 进行英语音频转录
- 使用 Whisper 进行非英语音频转录(支持 100+ 种语言)
- 使用 Whisper 将音频翻译到英语
- 使用 DeepL 将转录文本翻译到其他语言
- 支持保存转录为 TXT、VTT、SRT、TSV、JSON 格式
快速开始
- 打开 Google Colab 中的 AudioToText 笔记本
- 上传或指定音频文件路径
- 选择任务(转录或翻译)和语言
- 运行代码并等待处理完成
- 下载生成的文本或字幕文件
界面预览
与其他方案对比
| 对比项 | AudioToText | 同类方案 |
|---|---|---|
| 语言支持 | 支持 100+ 种语言转录,结合 DeepL 翻译 | 其他工具可能仅支持主流语言或需要额外翻译服务 |
| 使用便捷性 | 提供 Google Colab 在线使用,无需本地安装 | 其他工具通常需要下载安装或付费订阅 |
| 输出格式 | 支持 TXT、VTT、SRT、TSV、JSON 多种格式 | 其他工具可能仅支持基本文本格式 |
适合谁用
- 需要将音频转为文本的内容创作者
- 需要翻译音频文件的语言学习者
- 需要为视频添加字幕的制作者
下载与版本
当前最新版本为 master,发布于 。支持 Windows、macOS、Linux。
⚠️ 注意:本项目仅提供源代码下载,不包含可直接运行的安装包(exe/dmg/apk 等。下载后需要自行编译构建才能使用,适合有一定开发经验的用户。如果你不熟悉编译流程,建议寻找同类开箱即用的替代方案。
注意事项
- 本工具仅供学习和研究使用,请遵守相关法律法规。
- 请尊重内容创作者版权,勿将下载内容用于商业或非法传播。
- 项目源码地址:https://github.com/Carleslc/AudioToText