Browser Use Skill:让 AI Agent 操控浏览器自动化网页任务
总结
Browser Use 是一个开源浏览器自动化框架,能让 AI Agent 像真实用户一样操控浏览器——打开网页、点击按钮、填写表单、执行多步骤网页任务。用户只需用自然语言描述任务,框架即可自主完成。凭借 110k GitHub Stars 和 12k Forks,它已成为 AI Agent 操控浏览器领域最热门的开源项目之一,并在 Odysseys 排行榜以 87.4% 平均准确率位居第一,超越 OpenAI、Anthropic、Google 和微软的同类方案。
功能与原则
Browser Use 提供两大使用方式:CLI 工具和 Python 库。CLI 面向已接入 AI Agent(如 Claude Code、Codex、Cursor、OpenClaw)的用户,通过一条指令让 Agent 直接控制浏览器完成网页任务;Python 库则面向开发者,将浏览器自动化能力嵌入自建软件或产品。框架核心运行逻辑为:解析页面 DOM → 识别可交互元素 → LLM 决策下一步动作 → 执行点击/输入/导航等操作 → 循环直到任务完成。设计原则是最小化配置、最广泛兼容主流 LLM、支持本地运行和云端扩展两种模式。
认可度
- GitHub Stars:110k(截至 2026-08-22)
- Forks:12k
- Issues:109|Pull Requests:271(持续活跃维护)
- 编程语言:Python
- 许可证:MIT
- Odysseys 排行榜 #1:87.4% 平均准确率,领先所有同类方案
- GitHub Trending:长期占据 Python / AI 分类热门榜
链接
GitHub 仓库:https://github.com/browser-use/browser-use
原作者
browser-use 组织(github.com/browser-use),核心作者维护,配套文档见于 docs.browser-use.com,云端服务见于 cloud.browser-use.com。该项目在 GitHub Trending 上长期稳居 AI Agent 分类头部,是当前最受关注的浏览器自动化开源项目之一。
介绍
Browser Use 解决的核心问题是:让 AI Agent 能够操作需要登录、验证、复杂交互的真实网页,而不是只能读取静态 HTML 或调用死板的 API。框架基于 Playwright 构建,配合 LLM 的推理能力,使 Agent 能够理解网页结构、自主决策操作步骤,并以人类行为方式完成端到端任务。
开源版本完全免费,在本地运行,支持连接真实 Chrome Profile(保留登录状态),可配合任意 LLM(OpenAI GPT 系列、Anthropic Claude 系列、Google Gemini 等)。同时提供 Cloud 版,集成 Stealth 模式、代理轮换、CAPTCHA 解决、1000+ 应用集成(Gmail、Slack、Notion 等),适合规模化任务和企业级场景。
benchmark 完全开源(browser-use/benchmark),包含 100 个真实网页任务评测,确保能力可验证、可复现。框架还提供 Self-Healing Browser Harness,遇到页面结构变化时能自动修复操作路径,而非直接失败。
特点
- 跨 Agent 兼容:Claude Code、Codex、Cursor、OpenClaw 等主流 Agent 均可通过 CLI 一键接入
- 多 LLM 支持:通过
ChatBrowserUse支持 OpenAI GPT、Anthropic Claude、Google Gemini 等多种模型,统一 API 接口 - 真实浏览器控制:基于 Playwright + 真实 Chrome,可保留登录状态、处理复杂交互场景
- Cloud 版本能力:Stealth 模式防检测、代理轮换、CAPTCHA 解决、1000+ 第三方集成
- Self-Healing:browser-harness 组件能在页面结构变化时自动修复操作路径,提升任务成功率
- Benchmark 开源:100 个真实网页任务评测集公开可查,结果可复现
使用方法
方式一:CLI(让已有 Agent 控制浏览器)
安装并注册 Skill:
# 前提:Python 3.12+,通过 uv 或 pip 安装
uv add browser-use
# 或:pip install browser-use
# 注册 Skill
browser-use skill install
然后直接对 Agent 说:”请帮我填写这个职位申请表,用我的简历信息。”
方式二:Python 库(自建自动化软件)
import asyncio
from browser_use import Agent, ChatBrowserUse
async def main():
agent = Agent(
task="Find the number of stars of the browser-use repo",
llm=ChatBrowserUse(model='openai/gpt-5.5'),
# 或:llm=ChatBrowserUse(model='anthropic/claude-sonnet-4-6')
)
history = await agent.run()
if __name__ == "__main__":
asyncio.run(main())
环境变量配置(.env):
BROWSER_USE_API_KEY=your-key # 从 cloud.browser-use.com 获取
# 或使用自带 API Key
# ANTHROPIC_API_KEY=your-key
# GOOGLE_API_KEY=your-key
使用场景与人群
适用场景:
– 网页数据采集与监控(竞品价格、评论、库存)
– 自动填写多步骤表单(职位申请、保险报价、订单处理)
– 浏览器端 QA 自动化测试
– 跨平台网页操作工作流编排
– 需要登录态的自动化任务
目标用户:
– AI 应用开发者(将浏览器自动化能力嵌入 Agent 产品)
– 自动化工程师(替代传统 Playwright 脚本,加入 LLM 决策层)
– 运营/市场人员(批量处理需要登录态的网页任务)
– 研究人员(大规模网页数据采集)
输入与输出案例
案例一:查询 GitHub 仓库信息
Input:task="Find the number of stars of the browser-use repo"
Model:ChatBrowserUse(model='openai/gpt-5.5')
Output:Agent 自动打开 github.com → 搜索 browser-use → 进入仓库页
→ 读取星标数字 → 返回:"browser-use repo has 110k stars"
案例二:批量填写职位申请表
Input:
task="Apply to the machine learning engineer position at example.com using my resume info",
llm=ChatBrowserUse(model='anthropic/claude-sonnet-4-6')
Output:Agent 自动打开职位页面 → 导航到申请入口 →
识别表单字段 → 从简历提取姓名/邮箱/经历填入各栏 →
提交申请 → 返回申请确认截图/ID
GitHub:https://github.com/browser-use/browser-use
评论区
登录后可评论。