产品简介
ViDoRAG 是一个开源RAG框架,专为处理视觉丰富的文档设计。它利用多智能体动态迭代推理和混合多模态检索,解决大规模文档库中的复杂查询问题,适合研究人员和开发者用于文档问答和检索增强生成任务。

核心功能
- 引入ViDoSeek数据集,用于视觉文档检索-推理-回答评估
- 采用多智能体、演员-批评家范式进行迭代推理,增强噪声鲁棒性
- 基于高斯混合模型(GMM)的多模态混合检索策略,整合视觉和文本管道
- 集成多种嵌入模型,支持自定义检索器
- 提供评估代码,允许自定义评估流程
快速开始
- 安装依赖:创建conda环境并运行pip install -r requirements.txt
- 准备数据:下载ViDoSeek数据集并转换为图像
- 构建索引:运行ingestion.py嵌入数据集
- 运行检索:使用SearchEngine或HybridSearchEngine进行多模态检索
- 生成回答:调用ViDoRAG_Agents进行推理生成
界面预览

与其他方案对比
| 对比项 | ViDoRAG | 同类方案 |
|---|---|---|
| 检索增强生成性能 | 在ViDoSeek数据集上提升超过10% | 传统RAG基线模型 |
| 多模态处理能力 | 整合视觉和文本的混合检索策略 | 单一模态检索方法 |
适合谁用
- 进行视觉文档问答研究的科研人员
- 开发检索增强生成应用的工程师
- 需要处理复杂文档数据的AI从业者
下载与版本
当前最新版本为 main,发布于 。支持 Windows、macOS、Linux。
⚠️ 注意:本项目仅提供源代码下载,不包含可直接运行的安装包(exe/dmg/apk 等。下载后需要自行编译构建才能使用,适合有一定开发经验的用户。如果你不熟悉编译流程,建议寻找同类开箱即用的替代方案。
注意事项
- 本工具仅供学习和研究使用,请遵守相关法律法规。
- 请尊重内容创作者版权,勿将下载内容用于商业或非法传播。
- 项目源码地址:https://github.com/Alibaba-NLP/ViDoRAG