AI编程工具说自己能操控浏览器,但它们根本不在同一个层次——我把四个方案的账全算清楚了

大多数 AI 编程工具说自己能操控浏览器,但它们用的根本不是同一套工具,能力也完全不在一个层次上。今天把四个主流方案的真实差异全算清楚了。

先说结论

没有银弹。 如果你让 AI 调试 DOM 和渲染问题,chrome-devtools-mcp 是唯一能给你眼睛的工具。如果你要让 AI 重复跑一个固定流程,playwright-mcp 的确定性最强。如果你在搭一个自己的浏览器 agent 产品,stagehand 给的 SDK 自由度最高。如果你要抓数据或者做大面积监控,browser-use 的生态最完整。

为什么 AI 的浏览器操控是个坑

AI 编程工具说自己能操控浏览器,听起来很美好。但实际上,AI 对页面的感知能力和操控能力,是两个完全不同的问题。

感知能力决定 AI 能看见什么——是 DOM 结构?控制台日志?网络请求?渲染状态?还是只能截个图让模型猜?

操控能力决定 AI 能做什么——点击、填表、滚动、截图、执行 JS?每次行为是否可重复?

大多数工具只解决其中一个问题,有的甚至两个都没解决好。

chrome-devtools-mcp:AI 的眼睛

适合场景:调试 DOM、排查渲染问题、看网络请求、分析控制台错误。

核心能力:给 AI 开了一个 Chrome DevTools 的接口。AI 可以读取实时 DOM、监听控制台、查看网络瀑布流、检查 CSS Computed 样式、截取屏幕截图。这意味着 AI 不再靠截图让模型猜,而是真正拿到了浏览器的内部数据。Claude Code 在处理 Web 项目时就在用这个:访问性树快照用于结构性交互,截图用于看视觉问题。两者结合,AI 才能准确判断这个按钮在哪里以及这个样式为什么跑偏了。

安装方式:npx -y @modelcontextprotocol/server-chrome-devtools,然后在 Claude Code 里配置 MCP 路径即可。

局限性:不能做复杂的多步自动化流程,更适合调试而不是任务执行。

playwright-mcp:确定性自动化

适合场景:QA 自动化、烟雾测试、CI/CD 里跑固定流程。

核心能力:把 Playwright 的能力封装成 MCP 工具。Playwright 本身是微软做的浏览器自动化框架,支持所有主流浏览器,有非常成熟的调试工具和等待机制。playwright-mcp 的优势是确定性。你告诉 AI 打开这个页面,点击登录按钮,输入账号密码,提交,它每次都会用完全相同的方式执行。不会有截图误判,不会有随机点击。

这对 CI/CD 场景特别重要。你要的是一个能重复运行的自动化脚本,而不是一个每次行为都可能不同的 AI。

安装方式:npx -y @playwright/mcp-server。

局限性:本质上还是脚本执行,AI 在里面扮演的角色是写 Playwright 代码,而不是自己操控浏览器。

stagehand:搭浏览器 agent 的 SDK

适合场景:团队在构建自己的浏览器 agent 产品,需要在确定性脚本和 AI 驱动行为之间做平衡。

核心能力:提供了 act、extract、observe 三个核心原语,让开发者用自然语言驱动浏览器。同时底层是 Playwright,所以确定性的部分可以继续用 Playwright 的能力。stagehand 的核心逻辑是:在可靠性要求高的地方用 Playwright,在页面动态或不可预测的地方用 AI。单个脚本里可以混合硬编码步骤和 AI 驱动步骤。这比全让 AI 操控稳定得多,比全写死脚本灵活得多。

安装方式:npm install stagehand。

局限性:需要开发者自己搭 agent 逻辑,不是开箱即用的产品。

browser-use:最完整的生态

适合场景:大规模数据提取、竞争情报监控、需要绕过反爬的场景。

核心能力:GitHub 84k Stars,开源版本是 Python 库,云平台版本额外提供 CAPTCHA 解决、住宅代理(195+国家)、指纹伪造。已经训练了专用于浏览器任务的 LLM,比通用模型更快更便宜。Skill API 是它的特色:把任何一个网站交互流程定义成可复用的 API 端点,一次定义,长期调用。

安装方式:pip install browser-use(开源版)或 npm install browser-use-sdk(云平台 SDK)。

局限性:云平台有成本,开源版需要自己运维基础设施。

怎么选

chrome-devtools-mcp 适合需要 AI 真正看见浏览器的场景,不适合复杂多步流程。playwright-mcp 适合确定性自动化,不适合需要 AI 自主决策的场景。stagehand 适合在确定性和灵活性之间找平衡,不适合开箱即用。browser-use 适合完整生态和规模能力,不适合小团队低成本。

一个常见的错误是选错了工具:让 Claude Code 用 playwright-mcp 去做调试(它看不见 DOM 结构),或者用 chrome-devtools-mcp 做大规模数据抓取(它不是为这个设计的)。

下一步

如果你用 Claude Code 做 Web 开发,第一件事装 chrome-devtools-mcp。如果你同时需要调试和自动化,跑两个 MCP 服务不冲突。如果你有特定的重复流程需要 AI 跑,playwright-mcp 更可靠。

选对了工具,AI 的浏览器操控能力能提升一个档次。选错了,AI 看起来很忙,实际上什么都没做对。

评论区

0 条评论

登录后可评论。

小智·AI工具控 14 阅读