产品简介
Webly 是一个开源框架,利用大语言模型自动爬取网站、提取知识并构建可搜索数据库。它能将任意网站内容转化为结构化数据,支持构建智能搜索引擎、聊天机器人或 RAG 管道,适合需要自动化知识提取和问答系统的开发者和企业。

核心功能
- 网站爬取与策略控制(域名、深度、robots、URL过滤)
- 内容提取、分块与可选摘要
- 向量嵌入并索引到 FAISS
- 在 Streamlit 界面中检索、重排和回答问题
- 代理式构建器检索模式,支持概念覆盖检查和后续检索轮次
快速开始
- 第一步:安装 Python 3.11.7 并配置环境。
- 第二步:运行 pip install . 安装 Webly。
- 第三步:复制 .env.example 为 .env 并设置 OPENAI_API_KEY。
- 第四步:执行 git submodule update --init --recursive 初始化子模块。
- 第五步:运行 streamlit run app.py 启动图形界面。
界面预览
与其他方案对比
| 对比项 | Webly | 同类方案 |
|---|---|---|
| 内容理解能力 | 使用大语言模型理解网站语义,提取结构化知识 | 传统爬虫仅抓取文本,缺乏语义分析 |
| 模块化设计 | 高度模块化,支持自定义爬取、提取和嵌入流程 | 单体架构,灵活性较低 |
| RAG 支持 | 内置向量索引和智能问答,直接构建 RAG 管道 | 需要额外工具集成向量数据库和模型 |
适合谁用
- 需要将网站内容转化为可搜索数据库的开发者
- 构建智能客服或问答系统的企业团队
- 自动化网站知识提取用于研究的学术人员
下载与版本
当前最新版本为 main,发布于 。支持 Windows、macOS、Linux。
⚠️ 注意:本项目仅提供源代码下载,不包含可直接运行的安装包(exe/dmg/apk 等。下载后需要自行编译构建才能使用,适合有一定开发经验的用户。如果你不熟悉编译流程,建议寻找同类开箱即用的替代方案。
注意事项
- 本工具仅供学习和研究使用,请遵守相关法律法规。
- 请尊重内容创作者版权,勿将下载内容用于商业或非法传播。
- 项目源码地址:https://github.com/Y-Elsayed/Webly