产品简介
MediaCrawler MediaCrawler 是一款开源多平台自媒体数据采集工具,支持小红书、抖音、快手、B站、微博、贴吧、知乎等平台。它利用 Playwright 浏览器自动化技术,无需逆向加密算法,降低技术门槛,适合数据采集、学习和研究使用。

核心功能
- 支持7个主流自媒体平台
- 关键词搜索和指定ID爬取
- 二级评论和创作者主页爬取
- 登录态缓存和IP代理池
- 生成评论词云图
快速开始
- 安装 uv 和 Node.js 环境
- 进入项目目录运行 uv sync 安装依赖
- 配置Chrome浏览器开启远程调试
- 运行爬虫命令如 uv run main.py --platform xhs --lt qrcode --type search
界面预览

MediaCrawler 提供基于 Web 的可视化操作界面,可在浏览器中配置平台、登录方式和爬取类型,并实时查看运行日志与数据预览。
与其他方案对比
| 对比项 | MediaCrawler | 同类方案 |
|---|---|---|
| 技术门槛 | 无需JS逆向,基于浏览器自动化,降低难度 | 传统爬虫可能需要逆向复杂加密算法 |
| 平台覆盖 | 支持7个主流平台,一次工具满足多平台需求 | 其他工具可能只支持部分平台 |
适合谁用
- 需要采集社交媒体数据的研究人员
- 希望监控热点内容的自媒体运营者
- 学习爬虫技术的开发者或学生
下载与版本
MediaCrawler 没有预编译安装包,需下载源码后通过 Python 环境运行。点击页面「下载软件」按钮获取源码压缩包,解压后按上述快速开始步骤配置环境即可使用。
注意事项
- 本工具仅供学习和研究使用,请遵守相关法律法规,禁止用于商业或非法用途。
- 请尊重平台规则与内容创作者权益,勿将爬取数据用于侵权或大规模自动化抓取。
- 项目源码地址:https://github.com/NanmiCoder/MediaCrawler