AI 编程不用再写爬虫了!ScrapeGraphAI MCP 把网页数据直接塞进 Agent 工具链

写爬虫脚本是很多 AI 开发者的痛——Python requests 加 BeautifulSoup,一不小心就被反爬拦死,维护起来还特别脆弱。但你知道吗?AI 编程 Agent 其实可以直接帮你”问”网页要数据,不用写一行解析代码。

今天挖到一个超实用的 MCP 服务器——ScrapeGraphAI ScrapeGraph MCP Server,它把 AI 爬虫能力直接接进了 Claude Code、Cursor、Windsurf 等主流 AI 编程工具里。

它能干什么?

简单说,这是一个AI 驱动的网页数据提取框架,通过 Model Context Protocol 把 ScrapeGraph AI 的能力暴露给 AI Agent。

支持四大核心操作:

  • Smart Scrape:直接告诉 AI”我要从这个页面提取 X 信息”,AI 自动生成提取逻辑,不需要手写正则
  • Search:给定关键词和 URL,AI 帮你精准搜索并返回结构化结果
  • Crawl:异步多页面爬取,支持分页、状态查询、暂停/恢复
  • Schema:根据自然语言描述生成 JSON Schema,或者用 Schema 约束输出格式

另外还有监控任务(定时抓取 + 历史记录)和账户查询(积分/用量)两个辅助工具。

为什么值得装?

最大的爽点:不用写爬虫代码了。以前你要先分析页面结构、绕反爬、写解析逻辑,现在只需要在 AI 对话里说一句话。

举个例子:

“帮我抓取竞品页面上的定价信息和功能对比”

AI 收到这个请求 → 调用 ScrapeGraph 工具 → 返回结构化的 JSON 数据。整个过程不需要你手动打开浏览器 DevTools 分析 HTML。

这对做市场调研、竞品分析、动态数据监控的开发者来说,效率提升是质的飞跃。

怎么接入?

两种方式:

方式一:通过 Smithery(推荐)
一条命令搞定授权和安装:

npx -y @smithery/cli@latest install @ScrapeGraphAI/scrapegraph-mcp --client claude

Smithery 会自动处理 OAuth 和凭证管理。

方式二:本地部署
需要先申请 ScrapeGraph AI 的 API Key,然后:

pip install scrapegraph-mcp
export SGAI_API_KEY="your_key"
scrapegraph-mcp

在 Claude Code/Cursor/Windsurf 中添加 MCP Server 即可使用。

适用场景

  • 竞品定价和功能数据采集
  • 文档站点的批量信息抓取
  • 定时监控竞品页面变化
  • 给 RAG 系统补充实时网页数据
  • 任何需要”AI 直接读网页”的自动化场景

用 AI 编程工具最怕的就是来回切换——写代码、切浏览器、复制数据、再切回来。这个 MCP 直接把网页数据塞进 AI 的工具链里,中间环节全砍掉。

技术栈:Python + MCP + ScrapeGraph AI API,代码开源(MIT License)。

GitHub:https://github.com/ScrapeGraphAI/scrapegraph-mcp


GitHub: https://github.com/ScrapeGraphAI/scrapegraph-mcp

评论区

0 条评论

登录后可评论。

陈一铭 56 阅读