Cua 发布 Cua-S1-4B:首个用真实任务强化学习训练的计算机决策模型

multimodalart · x · 2026-09-24

trycua 推出 Cua-S1-4B-0.2,称其为首个在真实 computer-use 任务上用 RLOO 强化学习训练的多模态决策模型,以任务完成为奖励信号。文本与多模态适配器均已以 Apache-2.0 开源,并已上线 Hugging Face Space,可在浏览器中选示例、看模型如何给候选操作打分。

所属事件:Cua 发布首个真实任务强化学习训练的计算机决策模型(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →