产品推荐 2026-07-26

reader:免费的网页内容抓取与处理工具(源码)

为AI代理提供网页抓取与内容提取的开源工具,解决生产环境中网页访问的复杂性问题。

开源软件跨平台工具

产品简介

reader Reader是一款专为AI应用设计的开源网页基础架构。它提供生产级的网页抓取、爬取与自动化功能,能直接输出干净的Markdown内容。解决了开发者自行集成Puppeteer等库时面临的反爬虫绕过、浏览器管理、代理配置等难题,适合需要让AI代理稳定获取网页数据的开发者与工程师。

reader 主界面

核心功能

  • 反检测浏览器会话,支持Playwright/Puppeteer控制
  • 一键将任意URL抓取为干净的Markdown与HTML
  • 支持批量并发抓取与网站深度爬取
  • 智能清理导航栏、页脚、弹窗等非主要内容
  • 内置浏览器池、分层代理池与自动重试机制

快速开始

  1. 第一步:通过 npm install @vakra-dev/reader 安装主包。
  2. 第二步:运行 npx playwright install chromium 安装所需的浏览器引擎。
  3. 第三步:在代码中导入 ReaderClient,调用 scrape 方法并传入目标URL。
  4. 第四步:从返回结果中直接获取处理好的 Markdown 或 HTML 内容。

界面预览

reader 界面截图

与其他方案对比

对比项reader同类方案
集成复杂度开箱即用,提供统一的 scrape、crawl、browser 接口,屏蔽底层浏览器、反爬、代理等复杂性。需自行拼接 Puppeteer、Stealth 插件、代理管理和重试逻辑,维护成本高。
反检测能力从底层内置 TLS 指纹识别、WebDriver 标志隐藏、WebRTC 掩码等反检测技术。通常依赖通用的反检测插件,容易被网站识别和封锁。
生产就绪度提供浏览器池、健康监控、分级代理池和优雅降级机制,专为生产环境设计。多为原型或单次脚本,缺乏规模化运行、资源回收和故障恢复保障。

适合谁用

  • 需要为AI模型构建数据管道的机器学习工程师
  • 开发自动化网页爬虫的后端工程师
  • 研究网站内容结构的产品经理

下载与版本

当前最新版本为 v0.3.2,发布于 2026-07-01。支持 Windows、macOS、Linux。

⚠️ 注意:本项目仅提供源代码下载,不包含可直接运行的安装包(exe/dmg/apk 等。下载后需要自行编译构建才能使用,适合有一定开发经验的用户。如果你不熟悉编译流程,建议寻找同类开箱即用的替代方案。

注意事项

  • 本工具仅供学习和研究使用,请遵守相关法律法规。
  • 请尊重内容创作者版权,勿将下载内容用于商业或非法传播。
  • 项目源码地址:https://github.com/vakra-dev/reader