做数据抓取最烦什么?
写爬虫被反爬,解析 HTML 像考古,还要处理各种动态加载。
Crawl4AI 这个开源工具,7.9k star,专门解决这些问题。
它把网页抓取做成了 LLM 友好的格式:
• 自动处理 JavaScript 渲染,不用自己折腾 headless 浏览器
• 输出 Markdown,直接喂给 LLM 做 RAG 或 Agent
• 支持多线程,16 个并发同时抓,省时间
• 不用 API Key,pip install 就能跑
我试了下,抓一个 SPA 单页应用,传统爬虫要写半天,这个几行代码搞定。
适合谁?
• 做 AI 应用的,需要高质量网页数据
• 做知识库的,想自动化内容采集
• 做研究的,需要批量抓取公开信息
当然,抓取别人数据要注意版权和 robots.txt,别被抓进去。
GitHub:github.com/unclecode/crawl4ai
你们做数据抓取一般用什么?自己写爬虫还是现成的工具?
话题来源 @kun66666677
· 13K阅读 · ❤️169 · x.com/…↗ · 已改写,非原文转载
37 浏览 0 评论
0 反应













