当 AI Agent 需要操作浏览器:Steel Browser 想解决一个很实在的问题

AI Agent 需要操作浏览器:Steel Browser 想解决一个很实在的问题

你可能已经在用 Playwright 或者 Puppeteer 做浏览器自动化了。但如果你想让 AI Agent 真正”活”在浏览器里——带着登录态、Cookies、轮换 IP、绕过反爬——事情就变得非常琐碎。

Steel Browserhttps://github.com/steel-dev/steel-browser)想做的,就是把这套脏活打包成一个开箱即用的 API,让 AI Agent 和开发者专注于任务本身,而不是底层基础设施。目前已在 GitHub 收获 7,387 颗 Star、953 个 Fork,活跃开发中。


它到底能干什么

Steel Browser 定位是”AI Agent 的浏览器 API 层”,核心能力可以分为几块:

浏览器控制
底层基于 Puppeteer + CDP,可以通过 Puppeteer、Playwright 或 Selenium 连接使用。不只是”打开网页”,而是完整控制 Chrome 实例,包括执行 JavaScript、操作 DOM、处理弹窗等。

会话管理
这是它比普通爬虫框架更有价值的地方。每次创建 session 时,浏览器状态、Cookies、LocalStorage 都会被持久化。这意味着:登录一次,后续请求自动携带认证状态。不需要手动维护 Cookie Jar。

反爬与指纹管理
内置 stealth 插件和指纹管理,可以规避常见的 Bot 检测逻辑。这点对于需要抓取有反爬机制站点的 AI Agent 非常关键。

代理链支持
内置代理链管理,支持 IP 轮换。对于大规模数据采集场景,这是绕不开的需求。

浏览器工具
不需要自己写代码,API 直接提供:网页转 Markdown、可读性文本提取、截图、生成 PDF。这些在构建 RAG 知识库或内容分析 pipeline 时是高频需求。

扩展支持
可以加载自定义 Chrome 扩展,进一步增强浏览器能力。


MCP 支持:一个被低估的亮点

对于用 MCP(Model Context Protocol)构建 Agent 系统的团队来说,Steel Browser 的 MCP Server 支持值得特别关注。它可以无缝接入 Claude Code、Cursor 等主流 AI 编程工具的浏览器操作能力,不需要自己写 Playwright 适配层。

从最近的 Release 记录看,v0.5.3-beta(2026年4月)新增了 onSessionStart/onBeforeSessionEnd/onAfterSessionEnd 插件钩子,扩展性在持续增强。


适合谁 / 不适合谁

适合:

  • 需要让 AI Agent 自动操作网页(填表、登录、抓取内容)的开发者
  • 构建 RAG pipeline、需要将网页转成结构化文本的团队
  • 有大规模数据采集需求、且需要稳定代理轮换能力的项目
  • 不想自己维护浏览器基础设施、想要一个可靠 API 层的团队

不适合:

  • 只需要简单静态网页抓取,用 curl / requests 就够了,不需要它
  • 对浏览器完全无感的纯后端任务处理
  • 需要深度浏览器定制(比如特定 Chrome flag)的场景,目前 API 层未必支持所有底层能力

使用门槛

上手方式很直接:

方式一:Steel Cloud(推荐快速上手)
注册 https://app.steel.dev 后,通过 SDK 操作,不需要自己维护服务器。

方式二:本地 Docker 部署
一行命令起服务:

docker run -p 3000:3000 -p 9223:9223 ghcr.io/steel-dev/steel-browser

API 文档和调试 UI 分别在 http://localhost:3000http://localhost:3000/ui

SDK 支持:
Node.js(npm install steel-sdk)和 Python(pip install steel-sdk)都有官方 SDK,REST API 也有完整文档:https://docs.steel.dev/


实际场景举例

举几个我认为它真正能解决问题的场景:

场景一:让 Agent 自动完成网页操作
不需要模拟 HTTP 请求,Agent 可以像人一样在真实浏览器里操作——点击、填表、等待页面渲染。这对于处理复杂表单或需要 JavaScript 渲染的页面特别有用。

场景二:构建实时知识库
定时抓取新闻网站、论坛、文档页面,转换为 Markdown 存入向量数据库。整个 pipeline 只需要几行 Python:

from steel import Steel
client = Steel(steel_api_key="YOUR_KEY")
result = client.scrape(url="https://example.com")
print(result.content.markdown)

场景三:多账号管理
通过 Profiles API 管理多个浏览器配置文件,每个文件携带独立的登录态、Cookies,适合社交媒体管理或多账号运营场景。


下一步建议

如果你在构建需要 AI Agent 操作网页的系统,有几个可以马上做的步骤:

  1. 花 5 分钟跑起来docker run -p 3000:3000 ghcr.io/steel-dev/steel-browser,然后访问 http://localhost:3000/ui 看看调试界面
  2. 看 Cookbookhttps://github.com/steel-dev/steel-cookbook),里面有和 Playwright、Stagehand、Browser Use、OpenAI Agents、Claude Computer Use 的集成示例
  3. 如果你的 Agent 用了 MCP,直接参考文档的 MCP 接入方式,比自己写 Playwright 适配层省大量时间
  4. 关注反爬问题:如果目标是大型商业站点,先测试 Steel 的 stealth 模式是否够用,再决定是否上

Steel Browser 目前的定位很清晰:不做底层浏览器引擎,做的是上层的 API 抽象和配套工具链。这个思路在 AI Agent 爆发的当下是合理的——当每个团队都在让 Agent 操作网页时,谁能把基础设施做到最省心,谁就有价值。

GitHub:https://github.com/steel-dev/steel-browser
官网:https://steel.dev
文档:https://docs.steel.dev/

评论区

0 条评论

登录后可评论。

星火·GitHub 快讯 450 阅读