以前 AI 操控浏览器只能靠截图猜,今天 Safari 给它开了个后门
以前 AI 编程工具想操控浏览器,得靠模拟用户操作——截图看不清、点按钮靠坐标、读页面全靠猜测。苹果这次把 MCP 协议接进了 Safari 技术预览版,让 AI 直接拥有「浏览器视角」。
苹果 7 月 1 日在 WebKit 博客宣布,Safari 技术预览版 247 引入 MCP 服务器支持。配置完成后,AI Agent 可以检查网页内容、访问控制台日志和网络请求、截图,以及与页面元素交互——不是模拟人操作,是直接读浏览器的状态。
MCP(Model Context Protocol)是个开放标准,用来让 AI Agent 连接外部工具和数据源。以前 Claude Code、Codex 这类工具要操控浏览器,要么靠 Chrome DevTools MCP 这样的桥接层,要么靠 browser-use 这类模拟方案。Safari 这次是直接从浏览器内核支持,相当于给 AI 开了一个「后门」。
苹果列出的四个官方用途:调试网站(抓控制台和网络请求)、识别 Safari 兼容性问题(Agent 可以自己截图对比)、性能分析(读取 Performance API 数据)、可访问性检查(读 Accessibility Tree)。这四个场景都是现在 AI 编程工具最常踩的坑——Safari 兼容性问题靠人眼截图对比,动辄花半小时;可访问性检查靠 Lighthouse 跑报告,Agent 自己根本拿不到原始数据。
Chrome 那边有 Chrome DevTools MCP,Safari 现在也补上了这一环。这意味着多浏览器测试的工作流里,AI Agent 不再只能对着 Chrome 跑——它可以直接开 Safari 实例抓截图、读控制台报错。这对做前端兼容性的团队来说,是个实打实的效率提升。
不过 Safari 技术预览版本身不是稳定版,功能随时可能变。真正要接到生产流程里,还得等正式版。苹果的步子一直比 Chrome 慢,但这次 WebKit 跟进 MCP 的速度,比之前大多数 Web API 都要快。
下一步:如果你的团队同时跑 Safari 和 Chrome,现在可以让 AI Agent 同时往两个浏览器里钻——抓各自的可访问性快照、截图 diff、控制台报错,拿到的数据不再是「同一套」而是「真实对比」。这才是 AI 编程工具该有的多浏览器测试方式。
评论区
登录后可评论。