你以为 AI agent 只能靠截图猜按钮?今天 Vercel 开源了浏览器这件事把自动化彻底变了

做 QA 自动化,数据从 SaaS 工具里导出来没有 API;做竞品监控,竞品官网从来不给你留接口;做端到端测试,每次都要自己先把流程走一遍。这些事情做了三年,全靠人在点。2026 年 8 月 Vercel 开源了 Agent Browser,这件事把 AI 浏览器自动化从「截图猜按钮」彻底拉到了「结构化文本操控」——前者贵、慢、烧 token,后者便宜、快、精确。

根子在哪:像素优先的方案为什么跑不通

Anthropic 的 Computer Use 和 OpenAI 的 Operator 都是「视觉优先」思路——给模型一张截图,让它猜这是什么按钮、该点哪里。效果上确实能做任意网页,但代价是每一次「看」都是一张高清图打给视觉模型,一轮任务下来截图几十张,token 消耗轻松破百万。Vercel 的统计是:Computer Use 类方案每次任务平均 114K token,Playwright MCP 也要 27K token。用它做 CI 里的自动化测试?跑一次的成本够买一杯咖啡了。

更根本的问题是,视觉模型对网页结构的理解是「猜」出来的,不是「知道」的。网页改个样式、按钮换个位置,同样的截图方案可能就点错了。SPA 里动态加载的内容截图更是黑盒,模型根本看不见。

Agent Browser 的思路:让浏览器变成结构化接口

Vercel 的 Agent Browser 干的事情很简单:把浏览器对 AI agent 变成一个「带语义标签的结构化接口」,而不是一张像素图。

具体来说,它不靠截图,靠的是无障碍树(Accessibility Tree)。现代浏览器对每个页面都维护一棵无障碍树,记录每个元素是什么角色(button/input/heading)、标签是什么、当前状态是 checked/disabled/focused。这棵树本来就是给屏幕阅读器用的,语义信息完整且稳定。Agent Browser 把它直接交给 AI agent,再配上 ref 快照机制——每次操作前记录页面状态,操作后对比 diff,精确知道哪个元素变了、哪个元素消失了。

这样一来,模型拿到的不是「这有个蓝色按钮在右上角」,而是「这是一个 role=button、label=Submit、id=submit-btn 的元素」。没有歧义,不需要视觉推理,也不需要截图。

实测数据:token 消耗差一个数量级

Vercel 官方给了一组对比(nocode.tech 实测,2026-08):

方案 冷启动延迟 单次任务 Token 消耗 JS 执行
Agent Browser ~2s ~3K(结构化文本)
Computer Use ~2.2s ~114K(截图+视觉推理)
Playwright MCP ~2s ~27K(Accessibility 快照)
纯 fetch ~200ms 0(但拿不到 SPA 内容)

Agent Browser 的 token 消耗只有 Computer Use 的 2.6%、Playwright MCP 的 11%。对 CI 里跑 QA 自动化来说,这意味着每天跑 100 次 smoketest 的成本从几美元降到了几分钱。

冷启动延迟差不多,但 Agent Browser 跑的是真实 Chrome(通过 CDP 协议),不是 headless 模拟——登录态、Cookie、localStorage 和手动操作完全一致,不存在环境差异。

三种典型场景:哪些事情以前要靠人,现在可以交给 agent

场景一:SaaS 工具的数据导出。 很多工具没有 REST API,导出功能藏在三级菜单深处,CSV 要手动点。Agent Browser 可以让 agent 登录、导航、点按钮、写文件,四分钟完成一次完整导出。人要做十五分钟,还经常忘。

场景二:CI 里的自动化 UI 测试。 配合 Claude Code 的 QASkills 模式,每次 deploy 触发一次端到端 smoke test:注册流程、支付流程、仪表盘加载,每步截图留存、结果 pass/fail 记录。跑在 Playwright 之上,步骤可调试、可缓存、可重放。

场景三:竞品定价和功能变动监控。 每周一早上,agent 自动访问竞品官网、导航到 pricing 页面、对比上周快照、差异超过阈值则告警。没有 API,照样做,而且比 API 更准确——拿到的是真实用户看到的内容。

局限性:什么时候不该用它

Agent Browser 是为「结构化良好的现代 Web 应用」设计的。如果网页大量依赖自定义控件、canvas 绘制游戏、验证码墙,那无障碍树可能不够用。这种情况下 Computer Use 的像素推理反而更鲁棒。另外 Safari 和 Firefox 目前没有稳定 WebGPU 支持,Agent Browser 依赖 WebGPU,所以目前只能在 Chrome/Edge 上跑。

还有一个使用习惯的切换:Playwright 写的是确定性脚本,每个选择器、每个等待条件都是你写死的;Agent Browser 交给 AI 决定下一步,步骤不固定,出问题要靠 ref 快照回放定位,而不是单步调试。这需要新的调试思路。

怎么跑起来

npx skills add vercel-labs/agent-browser

Claude Code 和 Codex 都原生支持,不需要额外配置 MCP 服务器。首次启动会在本地开一个 CDP 端口的 Chrome 实例,登录一次之后 cookie 持久化,后续无需重新登录。

下一步

如果你在用 Claude Code 做开发,第一件事是把「每周重复的 Web 交互」列一个清单:导出数据、查竞品价格、做 smoke test。任何规律性的 Web 操作,只要现在是你自己在点,都值得让 Agent Browser 跑一次试试。

评论区

0 条评论

登录后可评论。

小智·AI工具控 15 阅读