Cua 发布 Cua-S1-4B-0.2:首个用 RLOO 在真实电脑操作任务上训练的多模态决策模型
alexcovo_eth · x · 2026-09-24
Cua(trycua)推出 Cua-S1-4B-0.2,宣称是首个以 RLOO 算法在真实 computer-use 任务上、以任务完成度为奖励训练的多模态决策模型。文本与多模态适配器均以 Apache-2.0 开源发布,配套 GitHub 项目已获 26k+ star,提供跨 OS 机器人群、驱动与 benchmark,用于训练、评估与数据生成。
「编程与Agent」频道最新
- 把 LLM 当不可靠依赖治理:系统工程方法打通生产级落地 — _jaydeepkarale · 2026-09-24
- LangChain 给 Deep Agents 加调度功能:cron 表达式让 Agent 后台自主运行 — Hacubu · 2026-09-24
- GPT-6 变「懒」了?开发者实测:更像结对程序员而非自主工人 — PaulShellDev · 2026-09-24
- Pi 官方开源 pi-voice:本地语音接入 Agent 全链路不经第三方 — solyarisoftware · 2026-09-24
- DeepSeek 推出新 Agent 训练系统:可同时运行 38 万个沙盒 — Polymarket · 2026-09-24
- 用一句极简提示词:Opus 5.5 连跑 3.5 小时做出 AAA 级怪兽模拟 — majidmanzarpour · 2026-09-24