Codex 终于能「看见」了!155K Star 的爬虫神器让 AI 不再抓瞎

你有没有这种感觉——让 AI 去网上找资料,它回来一个空壳,还一本正经告诉你「这页面没内容」。

不是 AI 不行,是它「眼睛」有问题。JS 渲染的页面、动态加载的内容,反爬保护严的站——直接抓瞎。

直到给 Codex 接了 Firecrawl,同一个页面干净的 Markdown 秒出。这玩意儿现在 165K GitHub Star,全站前 100,npm 每周 250 万下载量。

它到底是干嘛的

说白了就是:把网页变成 AI 能看懂的样子。你给它一个 URL,它还你干净的 Markdown、结构化 JSON 或者截图。导航栏、广告、弹窗全过滤掉,官方说输入 token 能省 93%。

数据很硬:125 万开发者15 万家公司、npm+PyPI 每周 250 万下载,覆盖 96% 的网页。

六个核心功能

  • Scrape — 抓单页。最常用的,JS 渲染的页面自动渲染完再抠,反爬代理全不用管。还能挂 schema 按字段返回 JSON,PDF/DOCX 直接解析。
  • Crawl — 爬整站。给起始 URL,顺着链接把整个网站抓回来。做 RAG 知识库的时候,一条命令导入整个文档站。
  • Map — 列出全站 URL,不抓内容先把所有链接列出来,秒回。做竞品监控的时候省了大事。
  • Search — 网页搜索,直接给关键词返回完整页面内容,一步出结果。
  • Agent — 自动干活,连 URL 都不用给,说「找一下竞品定价方案」,它自己搜自己读返回结果加来源链接。
  • Interact — 页面交互,藏在点击后面的数据(电商搜索结果、翻页列表),用人话指挥它操作,返回实时浏览器画面。

接 AI 编程工具,AI 终于不瞎了

有官方 MCP 服务器,Cursor、Claude Code、Windsurf 填几行配置就能用,装机量 40 万+。Codex 一条命令搞定:

npx -y firecrawl-cli@latest init --all --browser

装完就有搜索、抓取、爬站全套能力,前面说的「抓瞎」问题直接治好。

适合谁

  • 做 RAG 的:文档站灌知识库,比手写爬虫省心一百倍
  • 做竞品监控的:定时 Crawl 对手官网,字段级 JSON 进库
  • 玩 AI 编程的:给 Cursor/Codex 接 MCP,AI 有眼睛了

n8n、Zapier、Lovable 也有现成集成,不写代码也能接。

两个提醒

一是开源版是 AGPL-3.0,商用想清楚,不确定就用云版。二是默认遵守 robots.txt,合规靠自己。

155K Star 不是刷的。网页数据这层基础设施,做 AI 应用的绕不开。

GitHub:https://github.com/firecrawl/firecrawl


GitHub: https://github.com/firecrawl/firecrawl

评论区

0 条评论

登录后可评论。

林小秋 12 阅读