Codex 会操控电脑了!但三种模式差别巨大,用错等于白嫖
Codex 会操控电脑了!但你知道它有三种模式吗?
OpenAI 的 Codex 不只会写代码——它现在能直接操控你的电脑。但 Codex 团队成员 Jason 告诉我们:三种操控方式,差别巨大,用错场景等于白嫖。
第一种叫 Computer Use,最广也最慢。Codex 像真人一样看屏幕、点鼠标、敲键盘,操作任何图形界面——Spotify、Xcode、系统设置、iOS 模拟器都不在话下。没有 API 的应用它照样能搞定,这是其它方式做不到的。
代价就是慢。结构化插件直接调 API,Computer Use 得一步步看界面、找按钮、等响应、再检查结果。Jason 举了个真实例子:他的快递被偷了,Amazon 客服要等 25 分钟。他让 Codex 每五分钟检查一次聊天窗口,客服出现后改为每分钟一次,自动完成退款。他去洗了个澡,回来退款已经办好了😂
Mac 和 Windows 体验差距很大:Mac 上 Codex 在后台静默操作,你继续用电脑不受影响;Windows 上它必须占前台,操作期间你没法用那台机器。
Chrome 扩展:带着你的登录状态
第二种是 Chrome 扩展,让 Codex 使用你已经登录的浏览器会话——cookies、账号状态、已有标签页全带着。Gmail、LinkedIn、Salesforce、公司内部后台,这些需要登录的工具,Chrome 扩展是对的选择。
它还能同时控制多个标签页,在一个标签读信息,到另一个对比,再去第三个完成操作。Computer Use 也能操作浏览器,但它只认屏幕坐标;Chrome 扩展理解的是浏览器层面的上下文,聪明得多。
注意:网站会把 Codex 的点击当作你本人的操作。研究、浏览、起草可以放心自动化,但发送、发布、付款这类操作最好留给自己确认。
内置浏览器:给开发者的沙盒
第三种是内置浏览器,住在 Codex 的对话线程里,完全隔离,不带任何登录状态和 cookies。
这反而是开发场景的优势:本地开发服务器、文件预览、公共网页、响应式布局检查、视觉 bug 复现——这些是它的主场。Codex 改代码、操作页面、截图、再跑一遍,形成紧密的反馈循环。
Jason 最喜欢的功能是标注:直接在页面上点击某个元素留评论,比如”这个层级反了”,Codex 拿着截图和上下文去改代码,改完重新打开同一个页面等你下一轮标注。比来回传截图和文字描述高效一个量级。
怎么选?记住这张表
- 需要登录状态 → Chrome 扩展
- 需要操作桌面应用 → Computer Use
- 在做前端开发 → 内置浏览器
如果有现成的插件或 MCP 能完成任务,优先用结构化工具——视觉控制是最后手段。
Codex 正在快速迭代,三种操控方式背后的能力还在快速演进。建议直接上手玩,官方的 CLI 工具已经开源,门槛很低。
GitHub: https://github.com/openai/codex
评论区
登录后可评论。