项目详情

Cua

给 AI agent 一台真正能用的电脑——开源驱动 + 隔离云桌面 + 本地 VM + 专用模型 + 评测基准

trycua/cua MIT Swift + Python + TS 24.5k stars 2025-01 建仓

分类:AI Agent · 桌面自动化 · 虚拟化 · ← 返回汇总

项目速览

一句话定位

别人让 agent 聊天,Cua 让 agent 上机

Computer-Use 2.0 全家桶:Cua Driver 开源驱动三系统原生应用与浏览器,Lume 在 Apple Silicon 上开本地 macOS/Linux VM,Fleets 提供云端隔离桌面池,CUA-S1 提供专用决策小模型,Cua Bench 负责任务评测与训练轨迹导出。自带 agent 和模型即可接入。适合做桌面自动化、agent 安全沙箱、computer-use 研究与评测的团队。

BYO agent / model 同任务内 code ↔ API ↔ GUI 切换 商业化云 + 开源核心
项目速览

核心数据

24.5k
Stars
1.68k
Forks
1032
开放 Issues(体量=活跃+粗糙面)
5
核心组件(Fleets/Driver/S1/Lume/Bench)
3
支持系统(macOS/Win/Linux)
497MB
仓库(monorepo + 演示媒体)

GitHub API 采集于 2026-09-20 · 2025-01-31 建仓 · 最近 push 2026-09-20(当天仍活跃)· Cua AI, Inc. 公司运作

为什么存在

Computer-Use 2.0:任务不挑界面

1.0 的局限

纯 GUI agent(截图→点按)慢、贵、脆;纯 API agent 又卡在「没 API 的那 80% 软件」上。

2.0 的主张

同一个任务里,agent 在代码、API、图形界面之间自由切换——哪条路稳走哪条。

缺的基建

要跑起来需要:跨 OS 驱动、隔离沙箱、专用决策模型、可复现评测——Cua 把四件全造了。

类比浏览器自动化史:Selenium 之前人人写脆弱脚本,Driver + Sandbox 标准化之后生态才起来——Cua 想当 computer-use 时代的这层地基。

🔥 核心页

五大组件:一台「agent 电脑」的完整解剖

你的 Agent(Claude Code / Codex / Cursor / OpenClaw / 自研)—— BYO MCP · CLI · SDK Cua Driver —— 检查与操作原生应用 + 浏览器 后台投递不抢鼠标焦点 · 平台支持矩阵公开 · libs/cua-driver Lume · 本地 VM Apple Virtualization.framework macOS Tahoe restore image / Linux Cua Fleets · 云桌面池 run.cua.ai 商用:池化容量按需领取 同一套 Sandbox SDK 覆盖本地/云 其他沙箱形态 qemu-docker · kasm (web VNC) xfce / Omarchy 桌面镜像 CUA-S1 · System 1 专用小模型 结构化界面元素打分决策(非逐 token 生成)· 权重在 Hugging Face · libs/cua-s1 Cua Bench · 评测与数据生成 构建任务 → 评测 agent → 导出轨迹训模型 · 模拟任务零依赖起步 · libs/cua-bench
驱动与沙箱(开源核心) 辅助形态 模型与评测层 虚线 = 评测/数据流
组件深看

Cua Driver:agent 的「手」

README 的「第一课」很说明设计取向:让 agent 用计算器算 6×7 并验证屏幕上显示 42——操作+验证闭环从第一天就是默认心智。

组件深看

沙箱双层:本地 Lume 与云端 Fleets

Lume(本地,原独立明星项目并入)
  • Apple Silicon 上用 Apple Virtualization.framework 开原生 VM——不走模拟,性能接近裸机
  • 一条命令从 Apple restore image 拉起 macOS Tahoe VM,SSH 直连
  • Swift 编写,曾以 trycua/lume 独立走红后并入 monorepo
Fleets(云端,商业产品)
  • run.cua.ai 按需领取隔离 Linux 桌面,跑命令/截屏/操作应用
  • 池化容量:保留算力加速领取,但教程强制教你清理——账单意识写进文档
  • 本地与云共用同一套 Sandbox SDK,代码不锁死在某个环境

开源核心 + 商用云的经典组合:agent 在本机 Lume 里开发调试,上量了平移到 Fleets——迁移成本被 SDK 抹平。

组件深看

CUA-S1:给 computer-use 造「小脑」

  • System 1 语义:借用心理学双系统概念——快、专、无长推理的决策反射,与通用大模型的规划层(System 2)互补而非替代
  • 第一个 profile:forms:面对结构化界面元素与文档取值直接打分出决策,而非逐 token 生成回复
  • 边界清晰:动作排序交给应用代码,执行交给 Driver,模型只做「选哪个」
  • 开源形态:训练/评测/合成数据源码 MIT,权重与数据集放 Hugging Face(cua-s1-forms),各自带 model card
为什么这是聪明的切法

「用哪个 LLM 开浏览器」没有护城河;但一个为「界面元素选择」特调的小模型——便宜、快、可本地部署——是整条链路里最难被通用模型碾压的零件。

类比:不是再造一个大脑,是造脊髓反射。

组件深看

Cua Bench:没有评测就没有工程,只有演示

组合拳看懂了:Bench 产数据 → 训 S1 → S1 上 Driver → 跑在 Lume/Fleets 里 → 轨迹回 Bench。五个组件首尾相接成飞轮。

快速上手

三条命令,三种起步姿势

# Driver:装 agent 的手(macOS/Linux)
/bin/bash -c "$(curl -fsSL https://cua.ai/driver/install.sh)"

# Lume:本地起一台 macOS VM
/bin/bash -c "$(curl -fsSL https://cua.ai/lume/install.sh)"

# Bench:零依赖评测任务
uv tool install 'cua-bench[browser]'
uv tool run --from 'cua-bench[browser]' \
  playwright install chromium
  • 想给 agent 加电脑操控:装 Driver,走 MCP 接现有 agent
  • 想做安全沙箱实验:Lume 开 VM,坏了我重置
  • 想评测/训模型:Bench 起步,reward 跑通再接真环境
  • 要规模:run.cua.ai 领 Fleet 桌面(注意清理)
生态位

牌桌上的位置

方案定位vs Cua
Anthropic computer useAPI 能力 + 参考实现官方工具链;Cua 提供跨 OS 驱动/沙箱/评测的开源全栈基建
OpenAI Operator商用 agent 产品闭环产品 vs 开放组件——Cua 是给造 agent 的人用的
browser-use浏览器自动化只管浏览器;Cua 覆盖原生应用+浏览器(Computer-Use 2.0 主张)
OSWorld 等 benchmark学术评测论文基建 vs 可跑任务构建器 + 轨迹导出训练闭环
自管 QEMU/DockerDIY 沙箱Cua 连这类也留着口子(qemu-docker/kasm 都在库里)
适用场景 / 风险提示

谁该用,需要警惕什么

适合
  • 造 agent 的团队:需要比浏览器更宽的操控面与隔离沙箱
  • Apple Silicon 用户:Lume 是 macOS VM 最省心的原生路径
  • Computer-use 研究者:Bench + S1 源码 + HF 权重齐活,论文可复现
  • RPA 替代探索者:老软件没 API?让 agent 直接用 GUI
警惕
  • 1032 个 open issues:面铺得极宽,工程质量参差是真实风险
  • 商业化主导:Cua AI, Inc. 掌舵,开源核心与云服务的边界会移动
  • 可选依赖混许可证:OmniParser CC-BY-4.0、ultralytics AGPL(可选安装)——商用要读依赖树
  • 安全双刃剑:agent 操控真桌面,权限模型要认真配
潜力评估

未来空间

一年半 24.5k stars,五组件飞轮(Bench 产数据→训 S1→Driver 执行→沙箱承载→轨迹回流)是目前 computer-use 开源阵营最完整的基建拼图。看两点:S1 forms 能否证明「专用小模型碾压通用大模型」的成本故事,以及公司化运作能否守住开源核心的边界。评分 8.5。


上一个
Compositor
下一个
Awesome Jev
1 / 13