Codex 终于能「看见」了!155K Star 的爬虫神器让 AI 不再抓瞎
你有没有这种感觉——让 AI 去网上找资料,它回来一个空壳,还一本正经告诉你「这页面没内容」。
不是 AI 不行,是它「眼睛」有问题。JS 渲染的页面、动态加载的内容,反爬保护严的站——直接抓瞎。
直到给 Codex 接了 Firecrawl,同一个页面干净的 Markdown 秒出。这玩意儿现在 165K GitHub Star,全站前 100,npm 每周 250 万下载量。
它到底是干嘛的
说白了就是:把网页变成 AI 能看懂的样子。你给它一个 URL,它还你干净的 Markdown、结构化 JSON 或者截图。导航栏、广告、弹窗全过滤掉,官方说输入 token 能省 93%。
数据很硬:125 万开发者、15 万家公司、npm+PyPI 每周 250 万下载,覆盖 96% 的网页。
六个核心功能
- Scrape — 抓单页。最常用的,JS 渲染的页面自动渲染完再抠,反爬代理全不用管。还能挂 schema 按字段返回 JSON,PDF/DOCX 直接解析。
- Crawl — 爬整站。给起始 URL,顺着链接把整个网站抓回来。做 RAG 知识库的时候,一条命令导入整个文档站。
- Map — 列出全站 URL,不抓内容先把所有链接列出来,秒回。做竞品监控的时候省了大事。
- Search — 网页搜索,直接给关键词返回完整页面内容,一步出结果。
- Agent — 自动干活,连 URL 都不用给,说「找一下竞品定价方案」,它自己搜自己读返回结果加来源链接。
- Interact — 页面交互,藏在点击后面的数据(电商搜索结果、翻页列表),用人话指挥它操作,返回实时浏览器画面。
接 AI 编程工具,AI 终于不瞎了
有官方 MCP 服务器,Cursor、Claude Code、Windsurf 填几行配置就能用,装机量 40 万+。Codex 一条命令搞定:
npx -y firecrawl-cli@latest init --all --browser
装完就有搜索、抓取、爬站全套能力,前面说的「抓瞎」问题直接治好。
适合谁
- 做 RAG 的:文档站灌知识库,比手写爬虫省心一百倍
- 做竞品监控的:定时 Crawl 对手官网,字段级 JSON 进库
- 玩 AI 编程的:给 Cursor/Codex 接 MCP,AI 有眼睛了
n8n、Zapier、Lovable 也有现成集成,不写代码也能接。
两个提醒
一是开源版是 AGPL-3.0,商用想清楚,不确定就用云版。二是默认遵守 robots.txt,合规靠自己。
155K Star 不是刷的。网页数据这层基础设施,做 AI 应用的绕不开。
GitHub:https://github.com/firecrawl/firecrawl
评论区
0 条评论
登录后可评论。