产品简介
wechat_article_spider 这是一个微信公众号文章爬取的半自动化工具,最初为方便获取玄武实验室每日安全推送而开发。它使用 chromedp 模拟浏览器登录,支持关键词搜索和按时间筛选文章,动态更新 Cookies 以降低反爬虫风险。适合需要定期获取特定公众号内容的安全研究人员或普通用户,但不适用于大规模批量爬取。
核心功能
- 使用 chromedp 模拟浏览器操作登录和获取 Cookie
- 支持关键词搜索文章
- 支持按时间筛选获取文章
- Cookies 动态更新避免封号
- 下载文章保存为本地 HTML 或 JSON 文件
快速开始
- 注册微信公众号平台账号并安装谷歌浏览器
- 下载工具源代码(需 Go 环境)
- 配置 config.yaml 文件设置关键词和时间等参数
- 运行命令 go run main.go 开始爬取文章
界面预览
与其他方案对比
| 对比项 | wechat_article_spider | 同类方案 |
|---|---|---|
| 批量处理能力 | 半自动化设计,适合小规模单个公众号爬取,避免大规模请求触发反爬虫 | 其他大规模爬虫工具可能支持批量获取但易导致账号被封 |
| 反爬虫策略 | 请求间有时间间隔并动态更新 Cookies,降低封号风险 | 其他工具可能无间隔请求,增加反爬虫检测和封号概率 |
适合谁用
- 需要获取玄武实验室等安全公众号每日推送的安全研究人员
- 想小规模爬取单个微信公众号文章的普通用户
- 希望自动化保存公众号内容到本地的个人用户
下载与版本
当前最新版本为 v1.2.0,发布于 2022-04-22。支持 Windows、macOS、Linux。点击页面「下载软件」按钮即可下载打包好的版本,根据你的电脑/手机系统来选择对应的软件。
注意事项
- 本工具仅供学习和研究使用,请遵守相关法律法规。
- 请尊重内容创作者版权,勿将下载内容用于商业或非法传播。
- 项目源码地址:https://github.com/trganda/wechat_article_spider