11.2万 Stars 的 AI 浏览器 Agent:Browser-Use 让大模型自己操作网页

11.2万 Stars 的 AI 浏览器 Agent:Browser-Use 让大模型自己操作网页

大模型很聪明,但不会自己点击网页。Browser-Use 的目标是让 AI Agent 直接控制浏览器完成复杂任务——从数据采集到自动填表,从网页操作到端到端自动化,111K Stars,Python,MIT 协议。

Browser-Usebrowser-use/browser-use,⭐ 111,737,Python,MIT)是 AI 浏览器自动化框架,核心理念:让 AI Agent 直接控制真实的浏览器,而不是依赖 API 或爬虫——大模型看到的和人类一样,做的也和人类一样。

核心数据

指标 数值
⭐ Stars 111,737
🍴 Forks 12,874
💻 语言 Python
📜 许可证 MIT
🌐 云端 cloud.browser-use.com
📖 文档 docs.browser-use.com

它解决什么问题

传统网页自动化有两个极端:API 依赖(需要对方开放接口)或爬虫(脆弱、容易被封)。Browser-Use 的解法是让 AI 直接用浏览器工作——

  • 大模型自己判断页面结构,找到要点击的元素
  • 像真人一样操作:点击、输入、滚动、等待
  • 兼容任何网页,不需要对方提供任何 API
  • 支持 Cloudflare 等反爬机制的网站

技术亮点

1. 大模型控制真实浏览器

from browser_use import Agent

agent = Agent(
    task="帮我订明天北京到上海的机票",
    llm=your_llm
)
agent.run()

大模型自己分析页面、识别元素、执行操作,全程不需要写 DOM 选择器。

2. MCP 协议支持

支持 MCP(Model Context Protocol),可以接入 Cursor、OpenClaw 等支持 MCP 的 AI 工具,让 IDE 直接控制浏览器。

3. Cloud 服务 + 自托管

# 本地运行
pip install browser-use
browser-use run --task "你的任务"

# 或使用云端服务(更稳定,不用自己管浏览器)
# https://cloud.browser-use.com

4. 多步复杂任务

订机票:打开携程 → 选日期 → 选航班 → 填乘客信息 → 支付
数据采集:搜索关键词 → 逐条抓取 → 保存到本地
自动化测试:登录 → 操作 → 截图对比 → 报Bug

5. 视觉理解 + 结构化输出

Agent 不仅能看页面,还能把结果整理成结构化数据(JSON / CSV)输出。

安装使用

pip install browser-use

# 需要配合 Playwright 使用
playwright install chromium

# 编写任务
python run_task.py

和传统爬虫 / Selenium 的区别

特性 传统爬虫 Selenium Browser-Use
维护成本 高(页面变即失效) 高(需写选择器) 低(AI 自适应)
反爬能力 强(模拟真人)
复杂操作
AI 感知页面
需要 API

项目地址:github.com/browser-use/browser-use
云端服务:cloud.browser-use.com
文档:docs.browser-use.com

评论区

0 条评论

登录后可评论。