OpenAI 推出了 WebMCP,让 Agent 能直接操控浏览器。
MCP(Model Context Protocol)之前主要是本地工具调用,现在 OpenAI 把它扩展到了 Web 端。
核心能力:
• 直接读取和操作浏览器 DOM,不需要截图+OCR
• 支持复杂交互:点击、输入、滚动、表单提交
• 和 Codex、Notion、Tab 等工具联动
• 10 行代码就能接入现有 Agent
这意味着什么?
以前让 AI 操作网页,要么用 Playwright 写脚本,要么靠视觉模型猜位置。现在 Agent 可以直接"看懂"网页结构,精准操作。
应用场景:
- 自动化测试:直接操作 UI,不用写 XPath
- 数据采集:结构化提取网页内容
- 工作流自动化:自动填表、提交、下载
当然,安全是个问题。Agent 能操控浏览器,意味着也能做坏事。OpenAI 加了权限控制,但具体怎么防滥用,还得看实际运行。
GitHub:github.com/openai/webmcp
你们会让 Agent 操控自己的浏览器吗?
30 浏览 0 评论
0 反应













