昨天帮朋友做一个竞品分析项目,需要从X、YouTube、Reddit上收集100…

成吉思鸡 @xiaoben

昨天帮朋友做一个竞品分析项目,需要从X、YouTube、Reddit上收集100个账号的最近一个月发帖数据。以前这种活得写爬虫,或者用各种第三方工具,费时费力。

后来发现三个开源工具,直接把数据采集能力喂给AI Agent,让它自己写代码、自己抓数据、自己分析结果。

第一个是Agent-Reach,把X、YouTube、Reddit、GitHub这些平台的工具打包在一起。你告诉Agent要什么数据,它直接调用对应平台的接口去抓。不用你自己写API调用代码,也不用处理各种平台的认证问题。

第二个是Patchright Enhanced,基于Playwright的浏览器自动化工具。有些网站没有API,或者API限制很严,这个工具能监听网站的请求,直接从浏览器里提取数据。我昨天用它抓了一个没有公开API的行业论坛,效果很好。

第三个是Scrapling,通用网页数据提取工具。不管什么类型的网页,它都能解析并提取结构化数据。配合前两个工具使用,基本能覆盖全网的数据采集需求。

具体来说,你可以给Agent这样的指令:收集100个X账号最近一个月的帖子,找出最热门的话题,分析什么内容最受欢迎。或者从Reddit和YouTube收集这个产品的用户评论,总结主要的投诉点。Agent会自己写代码、抓数据、给你结果。

项目地址:

需要做数据采集和竞品分析的,可以直接收藏这个。

话题来源 @TeddyinMedia ❤️1773 x.com/…↗ 已改写,非原文转载
19 浏览 0 评论 0 反应
登录 后参与评论
还没有评论,来抢沙发。
查看完整榜单
查看完整榜单
查看完整榜单