让 AI 学会“自己上网干活”:微软 Webwright 把浏览器变成终端

AI 学会“自己上网干活”:微软 Webwright 把浏览器变成终端

你有没有这种感觉:现在的 AI 写代码已经很猛了,但一旦让它“去某个网站帮我填个表、查个机票、抓个竞品价格”,它立刻变成人工智障?

不是模型不行,是交互范式错了

微软最新开源的 Webwright 直接把这个问题连根拔起。它的核心思路很简单粗暴:别让 AI 学你点击哪里,让它学会写代码控制浏览器。

它到底是什么?

Webwright 是一个极简的浏览器智能体框架,把“浏览器”和“模型”彻底解耦。AI 不再是在浏览器里一步一步猜“下一步点哪”,而是获得一个终端,可以在里面启动浏览器、截图、查元素、写脚本、执行、看结果、修 bug——就像你自己手动调试 RPA 脚本一样。

官方说核心 agent 循环只有约 450 行 Python,Playwright 环境约 570 行。整个依赖就是 httpx + pydantic + playwright + typer,没有多余的 orchestration 层,没有隐藏的图引擎,没有多智能体 swarm。

性能炸裂:长程任务直接 SOTA

这是最让我意外的地方。Webwright 在两大真实网页基准上跑出了开源最高分:

  • Online-Mind2Web(300 个任务):用 GPT-5.4 达到 86.7%,超过所有开源方案;Claude Opus 4.7 也有 84.7%,而且 hard split 更强。
  • Odysseys(200 个长程任务,平均 76 步):GPT-5.4 达到 60.1%,比上一版 SOTA 高了 +15.6 分

为什么这么强?因为传统的“截图+预测坐标”方式在长任务里会不断累积误差,而 Webwright 让模型写的是可重跑的 Python 脚本——出错可以 debug、可以修、可以复用。代码比点击坐标更稳定,这是根本性的架构优势。

谁在用、怎么用?

Webwright 已经支持多个主流 AI 编程工具
Claude Code/plugin marketplace add microsoft/Webwright 然后安装
OpenAI Codex:同样的 marketplace,Codex CLI 直接读
OpenClawHermes Agent 也已支持

装上之后你可以直接说:“帮我查 SEA 到 JFK 的机票”,或者“帮我做一个可重用的脚本,以后查不同日期都能用”。Webwright 会自动生成 final_script.py,每一步截图存盘,关键节点做视觉自检。

还有个很酷的 Task2UI 模式:完成网页任务后,直接把结果渲染成一个基于 HTML 的迷你 web app,你可以打开复用。

我的看法

大多数 web agent 项目的问题都是“太复杂”:图引擎、多智能体、隐藏 orchestration、黑盒状态机。Webwright 的反思路径很对——把浏览器当环境,把代码当状态。Local workspace 里的脚本和日志才是真正的状态,浏览器用完就扔。

如果你在用 Claude Code / Codex,想做任何“让 AI 替你上网”的事,Webwright 是目前最值得试的方案,没有之一。

🔗 GitHub:https://github.com/microsoft/Webwright


GitHub: https://github.com/microsoft/Webwright

评论区

0 条评论

登录后可评论。

查看完整榜单
查看完整榜单
查看完整榜单