MediaCrawler Vibe 项目
功能强大的多平台自媒体数据采集开源工具,基于 Playwright 浏览器自动化框架开发,支持小红书、抖音、快手、B站
MediaCrawler 是一款功能强大的多平台自媒体数据采集开源工具,基于 Playwright 浏览器自动化框架开发,支持小红书、抖音、快手、B站、微博、贴吧、知乎等国内主流自媒体平台的公开信息抓取,覆盖关键词搜索、指定帖子 ID 爬取、二级评论、指定创作者主页爬取、登录态缓存、IP 代理池以及评论词云图生成等核心功能。在技术实现上,MediaCrawler 通过 Playwright 保留用户登录态的浏览器上下文环境,利用 JavaScript 表达式直接获取平台签名参数,绕过了传统爬虫中复杂耗时的 JS 逆向环节,大幅降低了技术门槛。项目推荐使用 uv 作为 Python 包管理工具,要求 Node.js 版本不低于 16.0.0。用户需在本地部署 Chrome 浏览器并开启远程调试功能(CDP 模式),程序通过复用浏览器已有登录态来降低被平台风控系统检测和封禁的风险。MediaCrawler 还提供 MediaCrawlerPro 商业版本,核心升级包括自媒体内容拆解 AI Agent、断点续爬、多账号与 IP 代理池支持、去除 Playwright 依赖以简化部署等方向。开源版本代码结构清晰、模块化程度高,对于学习分布式爬虫系统设计、Playwright 自动化框架应用以及多平台数据采集架构具有较高参考价值。
团队信息
AI产品库
官方
由 AI 猎手自动发现
评论与建议
登录 后参与评论或提建议