11.2万 Stars 的 AI 浏览器 Agent:Browser-Use 让大模型自己操作网页
11.2万 Stars 的 AI 浏览器 Agent:Browser-Use 让大模型自己操作网页
大模型很聪明,但不会自己点击网页。Browser-Use 的目标是让 AI Agent 直接控制浏览器完成复杂任务——从数据采集到自动填表,从网页操作到端到端自动化,111K Stars,Python,MIT 协议。
Browser-Use(browser-use/browser-use,⭐ 111,737,Python,MIT)是 AI 浏览器自动化框架,核心理念:让 AI Agent 直接控制真实的浏览器,而不是依赖 API 或爬虫——大模型看到的和人类一样,做的也和人类一样。
核心数据
| 指标 | 数值 |
|---|---|
| ⭐ Stars | 111,737 |
| 🍴 Forks | 12,874 |
| 💻 语言 | Python |
| 📜 许可证 | MIT |
| 🌐 云端 | cloud.browser-use.com |
| 📖 文档 | docs.browser-use.com |
它解决什么问题
传统网页自动化有两个极端:API 依赖(需要对方开放接口)或爬虫(脆弱、容易被封)。Browser-Use 的解法是让 AI 直接用浏览器工作——
- 大模型自己判断页面结构,找到要点击的元素
- 像真人一样操作:点击、输入、滚动、等待
- 兼容任何网页,不需要对方提供任何 API
- 支持 Cloudflare 等反爬机制的网站
技术亮点
1. 大模型控制真实浏览器
from browser_use import Agent
agent = Agent(
task="帮我订明天北京到上海的机票",
llm=your_llm
)
agent.run()
大模型自己分析页面、识别元素、执行操作,全程不需要写 DOM 选择器。
2. MCP 协议支持
支持 MCP(Model Context Protocol),可以接入 Cursor、OpenClaw 等支持 MCP 的 AI 工具,让 IDE 直接控制浏览器。
3. Cloud 服务 + 自托管
# 本地运行
pip install browser-use
browser-use run --task "你的任务"
# 或使用云端服务(更稳定,不用自己管浏览器)
# https://cloud.browser-use.com
4. 多步复杂任务
订机票:打开携程 → 选日期 → 选航班 → 填乘客信息 → 支付
数据采集:搜索关键词 → 逐条抓取 → 保存到本地
自动化测试:登录 → 操作 → 截图对比 → 报Bug
5. 视觉理解 + 结构化输出
Agent 不仅能看页面,还能把结果整理成结构化数据(JSON / CSV)输出。
安装使用
pip install browser-use
# 需要配合 Playwright 使用
playwright install chromium
# 编写任务
python run_task.py
和传统爬虫 / Selenium 的区别
| 特性 | 传统爬虫 | Selenium | Browser-Use |
|---|---|---|---|
| 维护成本 | 高(页面变即失效) | 高(需写选择器) | 低(AI 自适应) |
| 反爬能力 | 弱 | 弱 | 强(模拟真人) |
| 复杂操作 | ❌ | ✅ | ✅ |
| AI 感知页面 | ❌ | ❌ | ✅ |
| 需要 API | ✅ | ❌ | ❌ |
项目地址:github.com/browser-use/browser-use
云端服务:cloud.browser-use.com
文档:docs.browser-use.com
评论区
0 条评论
登录后可评论。