有个做数据采集的朋友跟我吐槽,说用某个爬虫API服务,一个月被收16美刀,结果速度还慢得要死。他一气之下自己写了个开源工具,扔到GitHub上,现在星标已经破了五万一千。
这个工具叫 crawl4ai,做的事情很简单:你把任意网址丢进去,它吐出干净的 Markdown 格式内容,直接喂给大模型就能用。
不需要 API Key,不需要注册账号,不按页数收费。我朋友实测下来,速度比他之前用的付费服务还快。
我昨天拿它试了一下抓取几个技术博客,确实离谱。以前用付费工具经常碰到的反爬限制、格式混乱、编码问题,它基本都处理好了。输出的 Markdown 干干净净,表格、代码块、图片链接都保留着,LLM 直接吃进去就行。
爬虫这东西的门槛其实早就没了,开源社区有大把成熟的方案。但市面上还是有不少服务在靠信息差收月费,用的还是几年前的技术栈。crawl4ai 这种工具一出来,那些收费服务的护城河基本就没了。
如果你平时需要批量抓网页内容做分析、训练数据、或者给 RAG 系统喂数据,可以试试这个。反正免费开源,跑起来比大部分付费方案都利索。
项目地址:github.com/unclecode/craw…
话题来源 @taozi0929
96.2K阅读 ❤️1570 x.com/…↗ 已改写,非原文转载
18 浏览 0 评论
0 反应












