产品简介
SeimiCrawler 是一款敏捷、分布式Java爬虫框架,完美支持SpringBoot。它通过XPath解析和分布式队列,降低开发高可用爬虫系统的门槛,提升效率。适合Java开发者和数据团队进行大规模数据采集,如SERP收集、监控分析。

核心功能
- 支持分布式爬取
- 完美兼容SpringBoot
- 内置XPath解析器JsoupXpath
- 集成SeimiAgent处理动态页面
- 分布式队列基于Redisson并使用BloomFilter去重
快速开始
- 添加Maven依赖cn.wanghaomiao:SeimiCrawler到项目
- 创建爬虫类继承BaseSeimiCrawler并实现startUrls和start方法
- 添加Main函数启动SeimiCrawler
界面预览


与其他方案对比
| 对比项 | SeimiCrawler | 同类方案 |
|---|---|---|
| 开发门槛 | 提供简单API和SpringBoot集成,降低新手门槛 | 可能需要更复杂的配置或第三方库支持 |
| 功能完整性 | 内置XPath解析、动态页面处理和分布式队列,开箱即用 | 可能需额外集成工具或自定义开发 |
适合谁用
- 需要开发数据采集系统的Java开发者
- 涉及大规模数据抓取的数据团队
- 需要处理动态页面爬取的工程师
下载与版本
当前最新版本为 v1.2.0,发布于 2016-07-21。支持 多平台。点击页面「下载软件」按钮即可下载打包好的版本,根据你的电脑/手机系统来选择对应的软件。
注意事项
- 本工具仅供学习和研究使用,请遵守相关法律法规。
- 请尊重内容创作者版权,勿将下载内容用于商业或非法传播。
- 项目源码地址:https://github.com/zhegexiaohuozi/SeimiCrawler