你以为网页只能让 AI 读?browser-use 今天让浏览器自己长出了手

browser-use 是一个让 AI Agent 直接操控浏览器的开源工具,MIT 许可证,GitHub 10万+ Stars。它把 Playwright 的 DOM 读取能力接给了大模型,让模型不只是读页面,而是真的能点按钮、填表单、滚页面。2026 年它支持 15+ 大模型 API,Claude/GPT/Gemini/DeepSeek 都能接,还自带 MCP Server,能直接装进 Claude Code。


AI 操控浏览器这件事喊了两年,真正落地最大的坑不是模型不够强,是浏览器太难驯服。

传统的 Computer Use 方案(比如 Anthropic 的官方 API)靠截图驱动:每一步都把整个页面拍一张图传给视觉模型,模型看完图再决定点哪里。这套方案通用性强,但贵——填一个五字段的表单要 15~20 次截图-分析-执行循环,每次都是一张高清图片上传 multimodel,Published 估计在 0.10~0.50 美元之间,一次简单任务就要几毛钱。而且截图分辨率一旦和真实视口不匹配,点坐标就会偏;页面滚动了一下,模型还在用旧图操作。

browser-use 的核心思路是:别用像素,用 DOM。

它不是在”看”页面,而是在”读”页面。Playwright 本身就有一个无障碍树(Accessibility Tree),一个中等复杂页面大约 5~15KB 文本,而同一页的全分辨率截图是 500KB~2MB。DOM 方案每一步传输的数据量比截图方案低 1~2 个数量级,对应的 token 费用和延迟也低得多。

在 WebVoyager benchmark 上,基于 DOM 的方案跑到 89%,纯截图的 Computer Use 跑 78%,差距不大但成本差了几十倍。

那什么时候还要用截图?当页面是自定义组件、Shadow DOM、或者视觉布局和 DOM 结构严重不匹配的时候——这时模型需要”看”而不是”读”。browser-use 支持混合模式:结构化数据走 DOM,复杂 UI 走截图,两条路径都保留。


三行代码跑起来的 Agent

npm install browser-use
# Python 版本(uv add browser-use)
import asyncio
from browser_use import Agent
from browser_use.llm.openai import ChatOpenAI

agent = Agent(
    task="去 Google 搜索 'TypeScript tutorials'",
    llm=ChatOpenAI(model="gpt-4o")
)
history = await agent.run()
print(history.final_result())

如果你用 TypeScript/Node.js,也有官方 port:npx browser-use 直接跑 CLI,支持 --headless 无头模式,任务结束后吐出结构化结果。

browser-use 官方还提供 Cloud 版($0.02/浏览器小时),内置反检测、代理轮换、CAPTCHA 绕过,开箱即用不需要自己维护基础设施。个人开发者和小型团队可以直接接入,不需要自己搭 Playwright 环境。


2026 年工具对比:谁在什么场景赢

不看场景直接比工具是耍流氓。按任务类型分:

简单重复表单填写、数据采集 → browser-use 开源版,75~85% 成功率,成本只有模型 API 费,搭建最快。

高度复杂、UI 不可预测 → Anthropic Computer Use / OpenAI Operator,成功率更高但单次成本 0.10~0.50 美元,适合偶尔一次的关键任务。

有反爬、大规模抓取 → Browserbase 云端管理浏览器,80~90% 成功率,自带 stealth 浏览器,$0.01~0.05/任务加模型费。

需要接入自己已有 Playwright 测试套件 → Playwright MCP Server,微软官方出品,接入成本最低,但需要自己处理 Agent 决策层。

内部工具自动化、成本敏感 → browser-use 开源版自建,所有主流 LLM 都能接,DeepSeek/Grok/Ollama 本地模型也不在话下。


browser-use Skill:让 Claude Code 直接操控你的浏览器

今年新增的杀手功能:npx browser-use skill install,能把 browser-use 注册为一个 CLI Skill,装进 Claude Code、Codex、Cursor 等主流编程工具。之后你在对话里说”帮我把这个页面填了”,AI 编程工具就会调用真实浏览器执行。

对于前端工程师来说,这意味着:你对着 AI 说需求,它不只是给你代码,它真的能把浏览器打开,填进去,点完,把结果截图给你看。写 E2E 测试的时间可以从几小时压到几分钟。


下一个坑:prompt 注入

browser-use 读的是无障碍树,但无障碍树本质上是页面内容的语义化表示。如果网页本身被注入了恶意内容,AI 读到并执行了,后果和 XSS 类似。生产环境里,AI 浏览器 Agent 需要和人的 Agent 一样做输入清理和执行域限制——这件事目前没有标准答案,是 2026 年整个 Browser Agent 赛道最大的工程挑战。


下一步:从安装到跑通第一个任务

# 安装 + 装 Playwright 浏览器
npm install -g browser-use
npx browser-use --install

# 用 Claude Code Skill 模式
npx browser-use skill install --target claude-code

# 或者直接跑一个单次任务
npx browser-use "打开 GitHub,搜索 browser-use 仓库,告诉我它有多少 Stars"

browser-use 不是银弹——高度动态的 SPA、验证码、登录态管理这些坑仍然存在。但对于表单自动化、竞品数据采集、定时监控网页变化这些明确边界内的任务,它已经把 AI 操控浏览器这件事从”演示 Demo”变成了”生产可用”。GitHub 10 万 Stars 不是白来的。

评论区

0 条评论

登录后可评论。

小智·AI工具控 15 阅读