27,697 颗星、一天发 11 个 release:trycua/cua 把”AI 操作电脑”做成了开源基础设施
27,697 颗星、一天发 11 个 release:trycua/cua 把”AI 操作电脑”做成了开源基础设施
打开 trycua/cua 的 GitHub 主页,你会先看到一句几乎像产品宣言的话:「Give AI agents computers they can use。」这个 2025 年 1 月才创建的仓库,目前已经攒下 27,697 颗星、1,949 个 Fork,1,022 个未关闭 Issue;License 是 MIT,主要语言写着 Rust。再往下翻 release 列表,会发现更反常识的一件事:仅 2026 年 10 月 1 日一天,就同时打出了 11 个版本号——cua-spaces-v0.2.0、sandbox-v0.9.0、lume-v0.6.0、agent-v0.9.0、bench-v0.3.0、core-v0.3.2……每个子项目都在独立演进。
这不是又一个”接入 ChatGPT 然后假装能点屏幕”的玩具。这家 Y Combinator S25 孵化的团队(项目自报「YC S25」),从一开始就在押注一件硬事:把”computer-use agent”做成可工程化、可基准测试、可自托管的开源底座。
「Computer-Use 2.0」是什么,为什么突然成了 AI 工程师的关键词
如果你只看 GitHub 趋势榜上 Agent 类项目最近几个月的更替,会发现「computer-use」是一个绕不开的词。它的源头要追到 OpenAI 在 2025 年 1 月 23 日发布的 Operator:背后是一套叫做 CUA(Computer-Using Agent)的模型,把 GPT-4o 的视觉能力与强化学习结合,让 AI 看屏幕、点鼠标、敲键盘。Anthropic 紧随其后,在 Claude 上线了「Computer Use」功能。Manus 则选了另一条路——直接给 AI 套一个完整 Linux 虚拟机做底座,多 Agent 分层。
Cua(trycua/cua)想做的事情不是再做一个 CUA 模型,而是补齐这个生态里最缺的一块:开源的、可被任何模型调用的 driver + 沙箱 + benchmark 三件套。它把自己的定位写成「Docker for computer-use agents」,对应官网标语「Scale computer fleets for every agent」(https://cua.ai)。把它拆开看,会发现六个相对独立、又在 README 里被刻意串起来的子项目:
- Cua Fleets:云端的隔离桌面舰队,你只要 provision 一个 Linux 桌面、跑命令、拿截图。它是 SaaS 入口 run.cua.ai 的核心。
- Cua SDK / CLI / Spaces:统一的本地/云桌面 SDK,安装一行
curl -fsSL https://cua.ai/install.sh | sh,可以同时管本地虚拟机、容器和远端云桌面。一个cua sb create ubuntu --on cloud就把环境从本地切到云。 - Cua Driver:让 AI 通过 CLI / MCP / typed SDK 检查并操作 macOS、Windows、Linux 上的原生应用和浏览器。最有噱头的能力是后台静默执行——AI 不抢你的光标、不切焦点、不动窗口,用户在前面写代码,AI 在后面修 bug。
- Lume:基于 Apple Silicon 上 Apple Virtualization.Framework 的本地 macOS / Linux 虚拟机管理器,跑 macOS Tahoe VM 接近原生速度,省去了 QEMU 的损耗。
- Cua Bench:建任务、跑 Agent、导轨迹(trajectory)的基准测试框架,提供
cua-bench[browser]一行安装,强调「不需要 Docker、不需要 VM 也能跑模拟任务」。 - CUA-S1:自家训练的小型专用 System 1 模型,主攻”表单填写”这种快速、低延迟的决策。模型权重托管在 Hugging Face(cua-ai/cua-s1-forms)。
这六个模块是分别发版的,每个子项目单独打 tag。从 10 月 1 日当天 11 个 release 可以看出,团队是把 monorepo 当成多个独立 SDK 在管,避免一个组件的版本节奏被另一个拖累。
「后台静默点屏幕」这个细节,为什么是 Cua 的护城河
Cua 在产品故事里反复强调的一个能力是「background delivery」——AI 操作 app 时不抢用户光标、不拿焦点、不切换 Space。
这件事听起来细,实际非常硬。传统方案用 Apple 的 CGEventPost 模拟鼠标点击,会真的把光标挪走、把焦点抢走,用户根本无法同时做别的事。Cua Driver 走的是 macOS 的 Accessibility API / Windows 的 UI Automation / Linux 的 AT-SPI(GNOME 和 KDE 都在用),拿到的是语义化的控件树,不是像素坐标。
实测(2026/04/24 TestingCatalog 报道)显示,让 Claude Code 跑 LibreOffice Calc、让 Codex 跑 Inkscape 都不影响你主屏的鼠标。这带来的直接商业价值是:你可以把 Claude Code 当成”后台实习生”,它修 bug 时你继续写代码。
2026 年 4 月 23 日,Cua Driver 又加上了多光标(multi-cursor)支持,多个 AI 进程可以并行操作同一台机器的多个 app,参考:Cua Driver opens macOS background app control with multi-cursor support for Claude Code and Codex。到 6 月 17 日,Linux 版本加上 Wayland 预览(Cua launches Cua Driver Linux),平台支持终于覆盖三大桌面。
2026 年 7 月,Cua 在官方博客正式定调这个能力为「Computer-Use 2.0」:一个 Agent 可以在同一个任务里自由切换 code、API 和图形界面,不再像 1.0 那样只能二选一。原文:Computer-Use 2.0。
真实使用门槛:先想清楚你的硬件和隐私预算
Cua 看起来很美,但真实使用门槛不低,分三档:
- 本地 macOS 体验最好:你得有 Apple Silicon 的 Mac(Intel 也能跑但性能打折),准备 60GB+ 磁盘存 macOS VM 镜像;需要给 Terminal / Cua Driver 授予 Accessibility、Screen Recording、Automation 等系统权限,国内大部分公司电脑这些权限 IT 不一定给开。
- Linux 桌面体验其次:Wayland 还处于 preview 阶段,X11 上比较稳;可以用 Lume 跑 macOS VM,但 Apple Silicon 上虚拟化 macOS 才合法,非 Apple Silicon 机器只能跑 Linux VM。
- Cua Fleets(云端)门槛最低:开箱即用,但要付费,且屏幕/键鼠数据走的是云端。Y Combinator Demo Day 上 Garry Tan 把它包装成「Docker for computer-use agents」(参考 Product Hunt),定位就是给 Agent 团队提供可租用的桌面舰队。
真实成本不在软件,而在视觉模型 API。CUA Review 2026 给出的账单结构是:Sonnet 4.6 调用价格 $3/$15 per million tokens,Opus 4.6 是 $5/$25。如果一个任务 Agent 看 100 屏、修 50 次,按每屏 ~3k token 估算,单任务几毛到几美元不等;放到生产环境是按月算的固定开销。这跟传统 RPA 一次性买 license 的成本模型完全不一样。
适合谁,不适合谁
适合:Cua 对个人开发者、Agent 团队、需要桌面端 AI 自动化又不想被单一云服务绑死的工程师几乎是目前最完整的开源选择。它支持 Python、TypeScript、Swift、Kotlin 四种语言 SDK,还能用 MCP 把 Cua Driver 直接挂到 Claude Code / Codex / Cursor / OpenClaw 上,让你的 AI 编程 Agent 顺便获得”动手能力”。2025 年 8 月 27 日还接入了 HUD 评测平台(Cua × HUD),GUI-Agent 的基准测试现在有了一条现成跑道。
不适合:纯 Web 自动化请继续用 Playwright/Puppeteer;纯浏览器侧操作 Operator/Claude Computer Use 已经够;想拿开源方案做企业级 RPA 的要再等等——SOC 2 Type I 已经有,但合规细节(HIPAA、FedRAMP)官网没明说。
下一步建议
如果你想真试一次:
# 1. 装 SDK(macOS / Linux)
curl -fsSL https://cua.ai/install.sh | sh
# 2. 起一个本地 Ubuntu 沙箱(gVisor 容器)
cua sb create ubuntu --name dev
# 3. 跑个命令 + 截图
cua sb exec dev uname -a
cua sb screenshot dev
# 4. 想跨平台一致,把环境切到云
cua sb create ubuntu --on cloud
cua config set default.on cloud
想跑基准测试:
uv tool install 'cua-bench[browser]'
uv tool run --from 'cua-bench[browser]' playwright install chromium
CUA-S1 的模型权重在 Hugging Face(cua-ai/cua-s1-forms),如果你想做表单填写这种垂直场景的小模型微调,可以直接拿过去。
最后聊一下定位。Computer-Use Agent 赛道现在分两派:一派押”通用大模型 + 浏览器截图”,代表是 OpenAI Operator、Claude Computer Use;另一派押”开源底座 + 任意模型可接入”,Cua 是这一派里跑得最远的一家。两种路线都会继续存在很长一段时间,但如果你不想被任何一家云服务锁死,Cua 这个 27k 星的 monorepo 几乎是你目前唯一不缺组件的开源选项。Computer-use 2.0 是不是真能像 Docker 那样变成基础设施,现在说还太早;至少从它一天发 11 个 release、半年跑过 686 次版本的节奏看——这是个正经在长期做的工程,不是营销号项目。
参考链接
- 仓库:https://github.com/trycua/cua
- 官网:https://cua.ai
- 文档:https://cua.ai/docs
- Hacker News Show HN:CUA-S1 – A System One Model for Computer Use
- Computer-Use 2.0 官方定义:https://cua.ai/blog/computer-use-2-ai-engineer-worlds-fair
- 中文实战评测:日增千星的 cua:让 AI 直接接管你的电脑桌面
- 竞品对照:CUA Review 2026、7 Best Computer-Use AI Agents in 2026
评论区
登录后可评论。