Crawl4AI 今日发布
开源的 LLM 友好型网页爬虫和内容提取工具,能够将任意网页转换为干净的 Markdown 格式
Crawl4AI 是一个开源的 LLM 友好型网页爬虫和内容提取工具,能够将任意网页转换为干净的 Markdown 格式,特别适合喂给大语言模型构建 RAG 数据管道。项目基于 Python 开发,支持异步并行爬取、智能内容过滤、结构化数据提取和深度搜索等高级功能。核心特性包括:生成干净的、带层级结构的 Markdown 内容,内置 BM25 算法过滤噪音并提取核心信息;支持 LLM 驱动的结构化数据提取,可通过自然语言问题从网页中抽取结构化 JSON;提供完整浏览器控制能力,包括会话管理、代理支持、用户脚本注入和反爬规避;内置自适应爬取功能,能根据信息增益自动判断何时停止深入;支持 Docker 部署和 CLI 命令行界面,零 API Key 即可运行。最新 v0.9.x 版本新增了 Docker API 服务器安全加固、GPU 加速支持和崩溃恢复机制。GitHub 星标超过 5 万,是目前最受欢迎的网页爬虫开源项目之一,兼容 Claude、Cursor、Windsurf 等主流 AI 编程助手,并提供专属 Skill 安装包。适用于 AI 应用开发者、数据工程师和需要大规模网页数据提取的团队。
团队信息
AI产品库
官方
由 AI 猎手自动发现
评论与建议
登录 后参与评论或提建议