Fetcher MCP:用自然语言控制浏览器抓取网页,AI 时代的爬虫神器
还在用 curl 抓网页?AI 时代你该试试这个
做 AI 应用开发、内容聚合、竞品监控……绕不开一个痛点:网页内容怎么高效地喂给 AI。传统爬虫遇到 JS 渲染就傻眼,动不动还要处理登录态、IP 限制、反爬机制。GitHub 上有个叫 Fetcher MCP 的开源项目,专门解决这个——让 AI Agent 直接用自然语言控制浏览器抓取任意网页,1,053 Stars,MIT 协议,直接用。
为什么值得装
它不是普通的爬虫,是一个基于 Playwright 无头浏览器的 MCP Server(Model Context Protocol)。装上之后,Claude / Cursor / 任何 MCP 兼容的 AI 助手,都能像操作本地工具一样操作网页抓取。
核心优势:
- JS 执行支持:动态渲染页面(React/Vue/Angular)不在话下,不需要找 API 接口
- 智能内容提取:内置 Readability 算法,自动去掉广告/导航/侧边栏,只留正文
- 输出格式灵活:HTML 或 Markdown 都能选,适配不同的下游场景
- 并行批量抓取:fetch_urls 工具支持多标签页并发,一次抓 N 个 URL 效率翻倍
- 资源拦截优化:自动屏蔽图片/字体/样式表请求,省带宽、提速
- 配置灵活:超时时间、内容提取规则、输出格式均可细粒度控制
怎么安装跑起来
一条命令搞定,不需要 Docker(当然也支持 Docker):
npx -y fetcher-mcp
首次安装 Playwright 浏览器:
npx playwright install chromium
配置到 Claude Desktop(Mac 示例)——在 ~/Library/Application Support/Claude/claude_desktop_config.json 加上:
{
"mcpServers": {
"fetcher": {
"command": "npx",
"args": ["-y", "fetcher-mcp"]
}
}
}
支持 Streamable HTTP 和 SSE 两种协议,MCP 客户端都能连。Docker 用户也有官方镜像:
docker run -p 3000:3000 ghcr.io/jae-jae/fetcher-mcp:latest
适合谁用
做 RAG(检索增强生成)需要抓取大量文章做知识库的开发者、用 AI 做竞品分析/舆情监控的产品运营、想让 AI 直接读网页内容而不是靠搜索 API 的折腾党。简单说——你需要 AI 读某个网页,直接说”帮我抓这个 URL”,比找接口/写爬虫省事 100 倍。
工具链完整,代码开源,MIT 随便用。安装量起来之后生态会越来越丰富,建议先 star 收藏。
GitHub:https://github.com/jae-jae/fetcher-mcp
评论区
0 条评论
登录后可评论。