腾讯有点牛逼啊,他们刚开源的 BrowserSkill,把做浏览器 Agent 最恶心的一道坎给做穿了:不再给 AI 开一个干干净净的空白浏览器,而是直接借你正在用的标签页,干完活再还给你(MIT 协议,全本地)。
对天天用 Cursor、Claude Code 写代码的人来说,这个工具值得先翻一遍,省得自己在浏览器自动化上反复踩坑。
以前所有工具的思路,都是在后台偷偷起一个没有 Cookie、没有登录记录的虚拟沙盒。看似安全干净,结果一进真实业务,全卡在登录墙和验证码前面。
BrowserSkill 的逻辑变了:既然你人就坐在屏幕前,为什么不直接让你给它开个门。
1️⃣ 标签页即借即还
原来的麻烦是,想让 AI 去内网系统查条数据,你得把 Cookie、Token、请求头从头配置一遍,过期了又得重来;现在的机制是,它通过底层接口直接挂进你现有浏览器的一个打开窗口,你在哪登录着它就在哪干活;干完该退的步骤自动退掉,把标签页完整交还给你,既不用在本地存明文密码,也不用重新走一遍繁琐的鉴权。
2️⃣ 人机验证当场回弹
以前是让爬虫去硬解滑块验证码,解不开就全流程崩溃;现在变成了关键节点人类介入,一碰到双重验证或安全弹窗,窗口直接浮现给你,你花两秒点完确认,模型立刻接手后面的长链路;比较克制的一点是,AI 每次借标签页之前必须弹窗向你确认,而且这个总开关焊死在你的浏览器原生设置里,不是运行时的命令行参数,模型再怎么产生幻觉,也没法靠提示词把自己偷摸放出来。
3️⃣ 做成 CLI 而不是 MCP
这是全篇最聪明的一步。现在大家都扎堆做臃肿的 MCP 服务,结果各个客户端支持程度参差不齐;腾讯直接把它做成了一个纯粹的命令行工具,只要你的 Agent 能在终端里跑 Shell,不管是 Cursor 还是本地脚本,调一行指令就能把浏览器拉起来,每一条执行逻辑在终端日志里看得清清楚楚。
大模型解析网页代码的能力已经足够过剩,但真正卡住自动化的,从来不是模型读不读得懂 HTML,而是它跟人类真实工作软件之间的那道信任边界。选自动化工具时,看它怎么在权限和效率之间留出安全断点,可能比看它声称能全自动做多少事重要得多。
话题来源 @AYi_AInotes
❤️38 x.com/…↗ 已改写,非原文转载
20 浏览 0 评论
0 反应














