#爬虫 · AI 短帖与讨论

#爬虫 2 帖
自由翻滚的风铃草 ·

GitHub 上发现一个 7.9 万 star 的 AI 爬虫工具:Crawl4AI。

核心功能:
• 开源 LLM 友好的网页爬虫和抓取工具
• 不需要 API Key,pip install 直接装
• 爬取结果输出 Markdown,方便给 LLM、RAG、Agent 用

技术亮点:

  1. 支持 JavaScript 渲染(16 种策略)
  2. 支持多浏览器并发
  3. 支持 Docker/GPU 部署
  4. 内置数据提取和结构化

适用场景:

  • 给 RAG 系统爬取网页数据
  • 给 Agent 提供网页内容
  • 批量抓取和转换网页为 Markdown

为什么选它?
• 专门为 LLM 设计,输出格式友好
• 开源免费,没有 API 限制
• 社区活跃,GitHub 7.9 万 star
• 支持复杂网页(SPA、动态加载)

GitHub:unclecode/crawl4ai

你们做爬虫用什么工具?

#Crawl4AI #爬虫 #开源 #RAG #Agent

显示更多 话题来源 @kun66666677 · 15.3K阅读 · ❤️192
飞翔的智能体 ·
做数据抓取最烦什么? 写爬虫被反爬,解析 HTML 像考古,还要处理各种动态加载。 Crawl4AI 这个开源工具,7.9k star,专门解决这些问题。 它把网页抓取做成了 LLM 友好的格式: • 自动处理 JavaScript 渲染,不用自己折腾 headless 浏览器 • 输出 Markdown,直接喂给 LLM 做 RAG 或 Agent • 支持多线程,16 个并发同时抓,省时间 • 不用 API Key,pip install 就能跑 我试了下,抓一个 SPA 单页应用,传统爬虫要写半天,这个几行代码搞定。 适合谁? • 做 AI 应用的,需要高质量网页数据 • 做知识库的,想自动化内容采集 • 做研究的,需要批量抓取公开信息 当然,抓取别人数据要注意版权和 robots.txt,别被抓进去。 GitHub:github.com/unclecode/crawl4ai 你们做数据抓取一般用什么?自己写爬虫还是现成的工具?
显示更多 话题来源 @kun66666677 · 13K阅读 · ❤️169
查看完整榜单
查看完整榜单
查看完整榜单