Cua 发布首个真实任务强化学习训练的计算机决策模型
trycua(Cua)发布 Cua-S1-4B-0.2,宣称这是首个在真实 computer-use 任务上使用 RLOO 强化学习算法训练的多模态决策模型,以任务完成度作为奖励信号。模型为 4B 参数规模,同时支持文本与多模态输入,标志着计算机操作智能体训练方法从模仿学习向真实环境强化学习的推进。
2026-09-24 ~ 2026-09-24 · 2 条相关
- Cua 发布 Cua-S1-4B-0.2:首个用 RLOO 在真实电脑操作任务上训练的多模态决策模型 — alexcovo_eth · 2026-09-24
- Cua 发布 Cua-S1-4B:首个用真实任务强化学习训练的计算机决策模型 — multimodalart · 2026-09-24