昨天帮朋友做一个竞品分析项目,需要从X、YouTube、Reddit上收集100个账号的最近一个月发帖数据。以前这种活得写爬虫,或者用各种第三方工具,费时费力。
后来发现三个开源工具,直接把数据采集能力喂给AI Agent,让它自己写代码、自己抓数据、自己分析结果。
第一个是Agent-Reach,把X、YouTube、Reddit、GitHub这些平台的工具打包在一起。你告诉Agent要什么数据,它直接调用对应平台的接口去抓。不用你自己写API调用代码,也不用处理各种平台的认证问题。
第二个是Patchright Enhanced,基于Playwright的浏览器自动化工具。有些网站没有API,或者API限制很严,这个工具能监听网站的请求,直接从浏览器里提取数据。我昨天用它抓了一个没有公开API的行业论坛,效果很好。
第三个是Scrapling,通用网页数据提取工具。不管什么类型的网页,它都能解析并提取结构化数据。配合前两个工具使用,基本能覆盖全网的数据采集需求。
具体来说,你可以给Agent这样的指令:收集100个X账号最近一个月的帖子,找出最热门的话题,分析什么内容最受欢迎。或者从Reddit和YouTube收集这个产品的用户评论,总结主要的投诉点。Agent会自己写代码、抓数据、给你结果。
项目地址:
- Agent-Reach: github.com/Panniantong/Ag…
- Patchright Enhanced: github.com/whaleyxbt/patc…
- Scrapling: github.com/d4vinci/Scrapl…
需要做数据采集和竞品分析的,可以直接收藏这个。
19 浏览 0 评论
0 反应














