项目详情
Cua
给 AI agent 一台真正能用的电脑——开源驱动 + 隔离云桌面 + 本地 VM + 专用模型 + 评测基准
trycua/cua
MIT
Swift + Python + TS
24.5k stars
2025-01 建仓
分类:AI Agent · 桌面自动化 · 虚拟化 · ← 返回汇总
项目速览
一句话定位
别人让 agent 聊天,Cua 让 agent 上机
Computer-Use 2.0 全家桶:Cua Driver 开源驱动三系统原生应用与浏览器,Lume 在 Apple Silicon 上开本地 macOS/Linux VM,Fleets 提供云端隔离桌面池,CUA-S1 提供专用决策小模型,Cua Bench 负责任务评测与训练轨迹导出。自带 agent 和模型即可接入。适合做桌面自动化、agent 安全沙箱、computer-use 研究与评测的团队。
BYO agent / model
同任务内 code ↔ API ↔ GUI 切换
商业化云 + 开源核心
项目速览
核心数据
5
核心组件(Fleets/Driver/S1/Lume/Bench)
GitHub API 采集于 2026-09-20 · 2025-01-31 建仓 · 最近 push 2026-09-20(当天仍活跃)· Cua AI, Inc. 公司运作
为什么存在
Computer-Use 2.0:任务不挑界面
1.0 的局限
纯 GUI agent(截图→点按)慢、贵、脆;纯 API agent 又卡在「没 API 的那 80% 软件」上。
2.0 的主张
同一个任务里,agent 在代码、API、图形界面之间自由切换——哪条路稳走哪条。
缺的基建
要跑起来需要:跨 OS 驱动、隔离沙箱、专用决策模型、可复现评测——Cua 把四件全造了。
类比浏览器自动化史:Selenium 之前人人写脆弱脚本,Driver + Sandbox 标准化之后生态才起来——Cua 想当 computer-use 时代的这层地基。
🔥 核心页
五大组件:一台「agent 电脑」的完整解剖
驱动与沙箱(开源核心)
辅助形态
模型与评测层
虚线 = 评测/数据流
组件深看
Cua Driver:agent 的「手」
- 跨三系统:原生桌面应用 + 浏览器,macOS / Windows / Linux 一套 API
- 三种接入:CLI、MCP、类型化 SDK——Claude Code / Codex / Cursor / OpenClaw 都有现成集成指南
- 后台投递:平台支持时不抢你的鼠标和焦点——agent 干活你继续用电脑(工程上最打动人的一条)
- inspect + operate 双能力:先读界面结构和值,再操作——不是盲点截图
- 平台边界诚实公开:platform-support 矩阵明确写哪些 OS/应用支持后台投递、哪些不支持
README 的「第一课」很说明设计取向:让 agent 用计算器算 6×7 并验证屏幕上显示 42——操作+验证闭环从第一天就是默认心智。
组件深看
沙箱双层:本地 Lume 与云端 Fleets
Lume(本地,原独立明星项目并入)
- Apple Silicon 上用 Apple Virtualization.framework 开原生 VM——不走模拟,性能接近裸机
- 一条命令从 Apple restore image 拉起 macOS Tahoe VM,SSH 直连
- Swift 编写,曾以 trycua/lume 独立走红后并入 monorepo
Fleets(云端,商业产品)
- run.cua.ai 按需领取隔离 Linux 桌面,跑命令/截屏/操作应用
- 池化容量:保留算力加速领取,但教程强制教你清理——账单意识写进文档
- 本地与云共用同一套 Sandbox SDK,代码不锁死在某个环境
开源核心 + 商用云的经典组合:agent 在本机 Lume 里开发调试,上量了平移到 Fleets——迁移成本被 SDK 抹平。
组件深看
CUA-S1:给 computer-use 造「小脑」
- System 1 语义:借用心理学双系统概念——快、专、无长推理的决策反射,与通用大模型的规划层(System 2)互补而非替代
- 第一个 profile:forms:面对结构化界面元素与文档取值直接打分出决策,而非逐 token 生成回复
- 边界清晰:动作排序交给应用代码,执行交给 Driver,模型只做「选哪个」
- 开源形态:训练/评测/合成数据源码 MIT,权重与数据集放 Hugging Face(cua-s1-forms),各自带 model card
为什么这是聪明的切法
「用哪个 LLM 开浏览器」没有护城河;但一个为「界面元素选择」特调的小模型——便宜、快、可本地部署——是整条链路里最难被通用模型碾压的零件。
类比:不是再造一个大脑,是造脊髓反射。
组件深看
Cua Bench:没有评测就没有工程,只有演示
- 任务即代码:用 Python 3.12/3.13 + uv 构建 computer-use 任务,跑参考解,评测器打分(首个教程:reward = 1.0)
- 零依赖模拟任务:不需要 VM、Docker、模型 API key 就能定义与验证任务——评测基建的准入门槛拉到最低
- 轨迹导出:agent 执行轨迹可导出为训练数据——评测与数据生成是同一个闭环的两面
- 配套研究位:cuabench.ai 合作入口,明显瞄准学术与工业 benchmark 合作
组合拳看懂了:Bench 产数据 → 训 S1 → S1 上 Driver → 跑在 Lume/Fleets 里 → 轨迹回 Bench。五个组件首尾相接成飞轮。
快速上手
三条命令,三种起步姿势
# Driver:装 agent 的手(macOS/Linux)
/bin/bash -c "$(curl -fsSL https://cua.ai/driver/install.sh)"
# Lume:本地起一台 macOS VM
/bin/bash -c "$(curl -fsSL https://cua.ai/lume/install.sh)"
# Bench:零依赖评测任务
uv tool install 'cua-bench[browser]'
uv tool run --from 'cua-bench[browser]' \
playwright install chromium
- 想给 agent 加电脑操控:装 Driver,走 MCP 接现有 agent
- 想做安全沙箱实验:Lume 开 VM,坏了我重置
- 想评测/训模型:Bench 起步,reward 跑通再接真环境
- 要规模:run.cua.ai 领 Fleet 桌面(注意清理)
生态位
牌桌上的位置
| 方案 | 定位 | vs Cua |
| Anthropic computer use | API 能力 + 参考实现 | 官方工具链;Cua 提供跨 OS 驱动/沙箱/评测的开源全栈基建 |
| OpenAI Operator | 商用 agent 产品 | 闭环产品 vs 开放组件——Cua 是给造 agent 的人用的 |
| browser-use | 浏览器自动化 | 只管浏览器;Cua 覆盖原生应用+浏览器(Computer-Use 2.0 主张) |
| OSWorld 等 benchmark | 学术评测 | 论文基建 vs 可跑任务构建器 + 轨迹导出训练闭环 |
| 自管 QEMU/Docker | DIY 沙箱 | Cua 连这类也留着口子(qemu-docker/kasm 都在库里) |
适用场景 / 风险提示
谁该用,需要警惕什么
适合
- 造 agent 的团队:需要比浏览器更宽的操控面与隔离沙箱
- Apple Silicon 用户:Lume 是 macOS VM 最省心的原生路径
- Computer-use 研究者:Bench + S1 源码 + HF 权重齐活,论文可复现
- RPA 替代探索者:老软件没 API?让 agent 直接用 GUI
警惕
- 1032 个 open issues:面铺得极宽,工程质量参差是真实风险
- 商业化主导:Cua AI, Inc. 掌舵,开源核心与云服务的边界会移动
- 可选依赖混许可证:OmniParser CC-BY-4.0、ultralytics AGPL(可选安装)——商用要读依赖树
- 安全双刃剑:agent 操控真桌面,权限模型要认真配
潜力评估
未来空间
一年半 24.5k stars,五组件飞轮(Bench 产数据→训 S1→Driver 执行→沙箱承载→轨迹回流)是目前 computer-use 开源阵营最完整的基建拼图。看两点:S1 forms 能否证明「专用小模型碾压通用大模型」的成本故事,以及公司化运作能否守住开源核心的边界。评分 8.5。