产品简介
reader Reader是一款专为AI应用设计的开源网页基础架构。它提供生产级的网页抓取、爬取与自动化功能,能直接输出干净的Markdown内容。解决了开发者自行集成Puppeteer等库时面临的反爬虫绕过、浏览器管理、代理配置等难题,适合需要让AI代理稳定获取网页数据的开发者与工程师。

核心功能
- 反检测浏览器会话,支持Playwright/Puppeteer控制
- 一键将任意URL抓取为干净的Markdown与HTML
- 支持批量并发抓取与网站深度爬取
- 智能清理导航栏、页脚、弹窗等非主要内容
- 内置浏览器池、分层代理池与自动重试机制
快速开始
- 第一步:通过 npm install @vakra-dev/reader 安装主包。
- 第二步:运行 npx playwright install chromium 安装所需的浏览器引擎。
- 第三步:在代码中导入 ReaderClient,调用 scrape 方法并传入目标URL。
- 第四步:从返回结果中直接获取处理好的 Markdown 或 HTML 内容。
界面预览

与其他方案对比
| 对比项 | reader | 同类方案 |
|---|---|---|
| 集成复杂度 | 开箱即用,提供统一的 scrape、crawl、browser 接口,屏蔽底层浏览器、反爬、代理等复杂性。 | 需自行拼接 Puppeteer、Stealth 插件、代理管理和重试逻辑,维护成本高。 |
| 反检测能力 | 从底层内置 TLS 指纹识别、WebDriver 标志隐藏、WebRTC 掩码等反检测技术。 | 通常依赖通用的反检测插件,容易被网站识别和封锁。 |
| 生产就绪度 | 提供浏览器池、健康监控、分级代理池和优雅降级机制,专为生产环境设计。 | 多为原型或单次脚本,缺乏规模化运行、资源回收和故障恢复保障。 |
适合谁用
- 需要为AI模型构建数据管道的机器学习工程师
- 开发自动化网页爬虫的后端工程师
- 研究网站内容结构的产品经理
下载与版本
当前最新版本为 v0.3.2,发布于 2026-07-01。支持 Windows、macOS、Linux。
⚠️ 注意:本项目仅提供源代码下载,不包含可直接运行的安装包(exe/dmg/apk 等。下载后需要自行编译构建才能使用,适合有一定开发经验的用户。如果你不熟悉编译流程,建议寻找同类开箱即用的替代方案。
注意事项
- 本工具仅供学习和研究使用,请遵守相关法律法规。
- 请尊重内容创作者版权,勿将下载内容用于商业或非法传播。
- 项目源码地址:https://github.com/vakra-dev/reader