browser-use Skill:让 AI Agent 操控浏览器完成网页任务的排行榜第一工具
总结
browser-use 是一个让 AI Agent 控制浏览器完成网页任务的 Python 库和 CLI 工具。用户用自然语言描述任务,AI 自动打开网页、点击按钮、填写表单、截图和数据抓取。它在 Odysseys 排行榜上以 87.4% 的得分位列第一,领先于 OpenAI、Anthropic、Google 和 Microsoft 的同类产品,GitHub 累计星标 85.4k,是目前最受欢迎的浏览器自动化 Agent 工具之一。
功能与原则
browser-use 的核心能力是将真实浏览器操作接入 AI Agent 工作流。它支持两种使用模式:
- Python 库模式:在代码中引入
browser_use,用 LLM 驱动自动化流程 - CLI 模式(本次 Skill 重点):
browser-use命令行工具,后台常驻 daemon,~50ms/次调用延迟,支持 chained commands
设计原则:不依赖 API 服务即可本地运行,用户可自带 LLM API Key(Anthropic、Google、OpenAI 均可),也可使用官方 Browser Use Cloud 托管服务。
认可度
- GitHub star:85.4k(截至 2026-07-31)
- SkillHub Hot 排名:#17,热度分数 35.9
- Odysseys 排行榜:#1,87.4% 平均完成率,评测覆盖 200 个长时序网页任务
- pip 下载量:稳定增长,官方持续维护
- 社媒讨论:X/Twitter、GitHub Trending 多次上榜,技术社区热度高
链接
GitHub:https://github.com/browser-use/browser-use
原作者
- 作者/组织:browser-use(GitHub organization)
- 定位:AI Browser Automation 领域的头部开源项目,背后有商业化云服务 browser-use.com 支持
介绍
browser-use 解决了 AI Agent 在真实网页环境中执行任务的难题。传统 RPA 工具依赖规则和坐标,而 browser-use 由 LLM 驱动——AI 自动理解页面结构、决定操作步骤、验证执行结果。
CLI 工具的典型工作流是:
browser-use open <url>— 打开目标网页(浏览器常驻后台)browser-use state— 获取页面可交互元素(含索引编号)browser-use click <index>/browser-use input <index> "text"— 按索引操作元素browser-use screenshot— 截图确认browser-use close— 关闭会话
命令支持 chaining,可一次性写:browser-use open https://example.com && browser-use state && browser-use input 5 "user@example.com" && browser-use click 7
支持多种浏览器模式:headless Chromium(默认)、headed 可视窗口、使用真实 Chrome Profile(继承登录状态)、CDP 远程连接,以及 Cloudflare Tunnel 暴露本地服务。
特点
- LLM 驱动的页面理解:不需要预定义选择器,AI 自动理解 DOM 结构并选择操作目标
- 多运行时兼容:Python 库支持任意 LLM(OpenAI/Anthropic/Google),CLI Skill 可接入 Claude Code、Codex、Cursor、OpenClaw 等 15+ Agent 平台
- 持久化会话:CLI daemon 保持浏览器状态,避免每次重新启动,速度接近原生
- Benchmark 领先:Odysseys 200 任务评测第一(87.4%),benchmark 代码完全开源可查
- Cloud 托管可选:官方提供云端 Browser,配备代理轮换 + captcha 解决,适合大规模任务
使用方法
安装 Python 库(uv 推荐):
uv add browser-use
# 或 pip install browser-use
设置 API Key(.env):
BROWSER_USE_API_KEY=your-key
# ANTHROPIC_API_KEY=your-key # 或自带
最小示例(Python):
import asyncio
from browser_use import Agent, ChatBrowserUse
async def main():
agent = Agent(
task="Find the number of stars of the browser-use repo",
llm=ChatBrowserUse(model='openai/gpt-5.5'),
)
history = await agent.run()
asyncio.run(main())
CLI 安装为 Skill(Claude Code 等):
Install or upgrade browser-use to the latest stable version with uv using Python 3.12, run `browser-use skill install` to register the skill, and connect it to my browser.
CLI 常用命令:
browser-use doctor # 诊断安装状态
browser-use open https://github.com # 打开网页
browser-use state # 获取元素索引
browser-use click 3 # 点击元素
browser-use input 5 "hello@example.com" # 输入文字
browser-use screenshot # 截图
browser-use python "print(browser.title)" # 执行 Python 脚本
browser-use close # 关闭会话
使用场景与人群
适用场景:
- 网页数据抓取(需要登录态的复杂页面)
- 表单自动填写与提交测试
- UI 自动化测试(跨浏览器)
- 定时巡检网页变化
- AI Agent 执行需要真实浏览器操作的任务
目标用户:
- AI Agent 开发者(需要浏览器操作能力的 LLM 应用)
- 自动化测试工程师(网页端到端测试)
- 数据工程师(网页数据采集)
- 运维/DevOps(定期网页状态监控)
输入与输出案例
案例一:自动求职申请
输入任务(Python 库模式):
task="Apply to the job at https://example.com/careers/engineering"
AI 自动执行:打开职位页 → 阅读 JD → 填写姓名/邮箱/简历字段 → 点击提交 → 返回申请结果
案例二:CLI 模式填写联系表单
browser-use open https://example.com/contact
browser-use state
# 返回:[{index:0, tag:"input", name:"full_name"...}, {index:1, tag:"input", type:"email"...}, ...]
browser-use input 0 "John Doe"
browser-use input 1 "john@example.com"
browser-use input 2 "Hello, I'm interested in your enterprise solutions."
browser-use click 3 # Submit
browser-use screenshot
输出:截图确认提交成功,返回表单提交后的感谢页面状态 JSON。
评论区
登录后可评论。