产品推荐 2026-07-23

MediaCrawler:开源免费的多平台自媒体数据爬虫工具

一个多平台自媒体内容爬虫,用于抓取小红书、抖音等平台的笔记和评论。

开源软件数据采集Python工具

产品简介

MediaCrawler MediaCrawler 是一款开源多平台自媒体数据采集工具,支持小红书、抖音、快手、B站、微博、贴吧、知乎等平台。它利用 Playwright 浏览器自动化技术,无需逆向加密算法,降低技术门槛,适合数据采集、学习和研究使用。

MediaCrawler WebUI 界面预览

核心功能

  • 支持7个主流自媒体平台
  • 关键词搜索和指定ID爬取
  • 二级评论和创作者主页爬取
  • 登录态缓存和IP代理池
  • 生成评论词云图

快速开始

  1. 安装 uv 和 Node.js 环境
  2. 进入项目目录运行 uv sync 安装依赖
  3. 配置Chrome浏览器开启远程调试
  4. 运行爬虫命令如 uv run main.py --platform xhs --lt qrcode --type search

界面预览

MediaCrawler 可视化 WebUI

MediaCrawler 提供基于 Web 的可视化操作界面,可在浏览器中配置平台、登录方式和爬取类型,并实时查看运行日志与数据预览。

与其他方案对比

对比项MediaCrawler同类方案
技术门槛无需JS逆向,基于浏览器自动化,降低难度传统爬虫可能需要逆向复杂加密算法
平台覆盖支持7个主流平台,一次工具满足多平台需求其他工具可能只支持部分平台

适合谁用

  • 需要采集社交媒体数据的研究人员
  • 希望监控热点内容的自媒体运营者
  • 学习爬虫技术的开发者或学生

下载与版本

MediaCrawler 没有预编译安装包,需下载源码后通过 Python 环境运行。点击页面「下载软件」按钮获取源码压缩包,解压后按上述快速开始步骤配置环境即可使用。

注意事项

  • 本工具仅供学习和研究使用,请遵守相关法律法规,禁止用于商业或非法用途。
  • 请尊重平台规则与内容创作者权益,勿将爬取数据用于侵权或大规模自动化抓取。
  • 项目源码地址:https://github.com/NanmiCoder/MediaCrawler