browser-use Skill:让 AI Agent 操控浏览器完成网页任务的排行榜第一工具

总结

browser-use 是一个让 AI Agent 控制浏览器完成网页任务的 Python 库和 CLI 工具。用户用自然语言描述任务,AI 自动打开网页、点击按钮、填写表单、截图和数据抓取。它在 Odysseys 排行榜上以 87.4% 的得分位列第一,领先于 OpenAI、Anthropic、Google 和 Microsoft 的同类产品,GitHub 累计星标 85.4k,是目前最受欢迎的浏览器自动化 Agent 工具之一。

功能与原则

browser-use 的核心能力是将真实浏览器操作接入 AI Agent 工作流。它支持两种使用模式:

  • Python 库模式:在代码中引入 browser_use,用 LLM 驱动自动化流程
  • CLI 模式(本次 Skill 重点):browser-use 命令行工具,后台常驻 daemon,~50ms/次调用延迟,支持 chained commands

设计原则:不依赖 API 服务即可本地运行,用户可自带 LLM API Key(Anthropic、Google、OpenAI 均可),也可使用官方 Browser Use Cloud 托管服务。

认可度

  • GitHub star:85.4k(截至 2026-07-31)
  • SkillHub Hot 排名:#17,热度分数 35.9
  • Odysseys 排行榜:#1,87.4% 平均完成率,评测覆盖 200 个长时序网页任务
  • pip 下载量:稳定增长,官方持续维护
  • 社媒讨论:X/Twitter、GitHub Trending 多次上榜,技术社区热度高

链接

GitHub:https://github.com/browser-use/browser-use

原作者

  • 作者/组织:browser-use(GitHub organization)
  • 定位:AI Browser Automation 领域的头部开源项目,背后有商业化云服务 browser-use.com 支持

介绍

browser-use 解决了 AI Agent 在真实网页环境中执行任务的难题。传统 RPA 工具依赖规则和坐标,而 browser-use 由 LLM 驱动——AI 自动理解页面结构、决定操作步骤、验证执行结果。

CLI 工具的典型工作流是:

  1. browser-use open <url> — 打开目标网页(浏览器常驻后台)
  2. browser-use state — 获取页面可交互元素(含索引编号)
  3. browser-use click <index> / browser-use input <index> "text" — 按索引操作元素
  4. browser-use screenshot — 截图确认
  5. browser-use close — 关闭会话

命令支持 chaining,可一次性写:browser-use open https://example.com && browser-use state && browser-use input 5 "user@example.com" && browser-use click 7

支持多种浏览器模式:headless Chromium(默认)、headed 可视窗口、使用真实 Chrome Profile(继承登录状态)、CDP 远程连接,以及 Cloudflare Tunnel 暴露本地服务。

特点

  • LLM 驱动的页面理解:不需要预定义选择器,AI 自动理解 DOM 结构并选择操作目标
  • 多运行时兼容:Python 库支持任意 LLM(OpenAI/Anthropic/Google),CLI Skill 可接入 Claude Code、Codex、Cursor、OpenClaw 等 15+ Agent 平台
  • 持久化会话:CLI daemon 保持浏览器状态,避免每次重新启动,速度接近原生
  • Benchmark 领先:Odysseys 200 任务评测第一(87.4%),benchmark 代码完全开源可查
  • Cloud 托管可选:官方提供云端 Browser,配备代理轮换 + captcha 解决,适合大规模任务

使用方法

安装 Python 库(uv 推荐):

uv add browser-use
# 或 pip install browser-use

设置 API Key(.env):

BROWSER_USE_API_KEY=your-key
# ANTHROPIC_API_KEY=your-key  # 或自带

最小示例(Python):

import asyncio
from browser_use import Agent, ChatBrowserUse

async def main():
    agent = Agent(
        task="Find the number of stars of the browser-use repo",
        llm=ChatBrowserUse(model='openai/gpt-5.5'),
    )
    history = await agent.run()

asyncio.run(main())

CLI 安装为 Skill(Claude Code 等):

Install or upgrade browser-use to the latest stable version with uv using Python 3.12, run `browser-use skill install` to register the skill, and connect it to my browser.

CLI 常用命令:

browser-use doctor                          # 诊断安装状态
browser-use open https://github.com         # 打开网页
browser-use state                           # 获取元素索引
browser-use click 3                         # 点击元素
browser-use input 5 "hello@example.com"     # 输入文字
browser-use screenshot                      # 截图
browser-use python "print(browser.title)"   # 执行 Python 脚本
browser-use close                           # 关闭会话

使用场景与人群

适用场景:

  • 网页数据抓取(需要登录态的复杂页面)
  • 表单自动填写与提交测试
  • UI 自动化测试(跨浏览器)
  • 定时巡检网页变化
  • AI Agent 执行需要真实浏览器操作的任务

目标用户:

  • AI Agent 开发者(需要浏览器操作能力的 LLM 应用)
  • 自动化测试工程师(网页端到端测试)
  • 数据工程师(网页数据采集)
  • 运维/DevOps(定期网页状态监控)

输入与输出案例

案例一:自动求职申请

输入任务(Python 库模式):

task="Apply to the job at https://example.com/careers/engineering"

AI 自动执行:打开职位页 → 阅读 JD → 填写姓名/邮箱/简历字段 → 点击提交 → 返回申请结果

案例二:CLI 模式填写联系表单

browser-use open https://example.com/contact
browser-use state
# 返回:[{index:0, tag:"input", name:"full_name"...}, {index:1, tag:"input", type:"email"...}, ...]
browser-use input 0 "John Doe"
browser-use input 1 "john@example.com"
browser-use input 2 "Hello, I'm interested in your enterprise solutions."
browser-use click 3  # Submit
browser-use screenshot

输出:截图确认提交成功,返回表单提交后的感谢页面状态 JSON。


GitHub: https://github.com/browser-use/browser-use

评论区

0 条评论

登录后可评论。

Skill超级捕获手 1076 阅读