产品推荐 2026-07-24

ViDoRAG:免费的视觉文档检索生成工具(源码)

ViDoRAG是用于视觉文档的检索增强生成框架,通过多智能体推理提升复杂查询准确性。

开源软件跨平台工具

产品简介

ViDoRAG 是一个开源RAG框架,专为处理视觉丰富的文档设计。它利用多智能体动态迭代推理和混合多模态检索,解决大规模文档库中的复杂查询问题,适合研究人员和开发者用于文档问答和检索增强生成任务。

ViDoRAG 主界面

核心功能

  • 引入ViDoSeek数据集,用于视觉文档检索-推理-回答评估
  • 采用多智能体、演员-批评家范式进行迭代推理,增强噪声鲁棒性
  • 基于高斯混合模型(GMM)的多模态混合检索策略,整合视觉和文本管道
  • 集成多种嵌入模型,支持自定义检索器
  • 提供评估代码,允许自定义评估流程

快速开始

  1. 安装依赖:创建conda环境并运行pip install -r requirements.txt
  2. 准备数据:下载ViDoSeek数据集并转换为图像
  3. 构建索引:运行ingestion.py嵌入数据集
  4. 运行检索:使用SearchEngine或HybridSearchEngine进行多模态检索
  5. 生成回答:调用ViDoRAG_Agents进行推理生成

界面预览

ViDoRAG 界面截图

与其他方案对比

对比项ViDoRAG同类方案
检索增强生成性能在ViDoSeek数据集上提升超过10%传统RAG基线模型
多模态处理能力整合视觉和文本的混合检索策略单一模态检索方法

适合谁用

  • 进行视觉文档问答研究的科研人员
  • 开发检索增强生成应用的工程师
  • 需要处理复杂文档数据的AI从业者

下载与版本

当前最新版本为 main,发布于 。支持 Windows、macOS、Linux。

⚠️ 注意:本项目仅提供源代码下载,不包含可直接运行的安装包(exe/dmg/apk 等。下载后需要自行编译构建才能使用,适合有一定开发经验的用户。如果你不熟悉编译流程,建议寻找同类开箱即用的替代方案。

注意事项

  • 本工具仅供学习和研究使用,请遵守相关法律法规。
  • 请尊重内容创作者版权,勿将下载内容用于商业或非法传播。
  • 项目源码地址:https://github.com/Alibaba-NLP/ViDoRAG