Codex联网抓瞎?接这个155K Star的爬虫神器给AI装上眼睛
Codex联网找资料,结果抓回来一个空壳?
事情是这样的。我天天让 Codex 联网找资料、翻文档、盯 GitHub 热榜。但 Codex 自带的联网功能碰到 JS 渲染的页面直接抓瞎——抓回来一个空壳,还一本正经告诉我「这页面没内容」。
后来接了 Firecrawl,同一个页面干净的 Markdown 秒出。这个东西现在 155K Star,GitHub 全站前 100。
它到底是干嘛的
说白了就是把网页变成 AI 能看懂的样子。你给它一个 URL,它还你干净的 Markdown、结构化 JSON 或者截图。导航栏、广告、弹窗全过滤掉,官方说输入 token 能省 93%。
数据很硬:125 万开发者、15 万家公司、npm + PyPI 每周 250 万下载。
六个核心功能
- Scrape — 抓单页。最常用的,JS 渲染的页面自动渲染完再抠,反爬代理全不用管。还能挂 schema 按字段返回 JSON,网页上挂的 PDF/DOCX 直接解析。
- Crawl — 爬整站。给起始 URL,顺着链接把整个网站抓回来,深度、页面数、路径过滤都能配。做 RAG 知识库的时候,导入整个文档站就一条命令。
- Map — 列出全站 URL。不抓内容,先把域名下所有 URL 列出来,秒回,还能带搜索词过滤。
- Search — 网页搜索。直接给关键词搜索,返回每条结果的完整页面内容,适合深度研究类 Agent。
- Agent — 自动干活。URL 都不用给,说「找一下 Notion 的定价方案」,它自己去搜去读,返回结果加来源链接。
- Interact — 页面交互。电商搜索结果、翻页列表这些藏在点击后面的数据,用人话指挥它去操作,返回实时浏览器画面。
接 AI 编程工具,超快
有官方 MCP 服务器,Cursor、Claude Code、Windsurf 填几行配置就能用,装机量 40 万 +。Codex 一条命令搞定:
npx -y firecrawl-cli@latest init --all --browser
装完 Codex 就有搜索、抓取、爬站全套能力,前面说的抓瞎问题直接治好。
适合谁
- 做 RAG 的:文档站灌知识库,比手写爬虫省心太多
- 做竞品监控的:定时 Crawl 对手官网,字段级 JSON 进库
- 玩 AI 编程的:给 Cursor/Codex 接 MCP,AI 有眼睛了
n8n、Zapier、Lovelace 也有现成集成,不写代码也能接。
两个注意
覆盖 96% 的网页,剩下的 4% 是防护最严的站,抓不动就是抓不动。开源版 AGPL-3.0 协议,商用想清楚,不确定就用云版。
155K Star 不是刷的。网页数据这层基础设施,做 AI 应用的绕不开。
GitHub:https://github.com/firecrawl/firecrawl
评论区
0 条评论
登录后可评论。