有个哥们被某个爬虫服务按月收16刀,用了几个月越想越不对劲,干脆自己写了个开源的扔到GitHub上,结果现在攒了5.1万星。
这个工具叫 crawl4ai,干的事情很简单:你把任何网址丢进去,它给你吐出来干净的 Markdown,LLM 直接就能吃。
不用 API key,不用注册账号,不按页数算钱。跑起来比我之前用过的几个付费爬虫服务还快。
我自己试了一下,确实离谱。以前用某些服务爬个几十页就要开始限速,这个直接跑,速度稳定。
而且它不是那种只能爬静态页面的玩具。动态渲染、JavaScript 重度依赖的页面也能处理,这点比很多付费方案强。
最关键的是数据全在本地,不用担心爬的内容被第三方存一份。
说个实际场景:我之前要做一个竞品监控,需要每天抓十几个竞品网站的产品更新。用付费服务一个月少说几十刀,换成这个之后直接本地跑定时任务,零成本。
爬虫这个领域其实门槛早就没了,但不少服务还在靠信息差收月费。开源工具做到这个水平,付费服务的护城河基本不存在了。
项目地址:github.com/unclecode/craw…
话题来源 @taozi0929
106.3K阅读 ❤️1726 x.com/…↗ 已改写,非原文转载
23 浏览 0 评论
0 反应












