Cua 发布 Cua-S1-4B:首个用真实任务强化学习训练的计算机决策模型
multimodalart · x · 2026-09-24
trycua 推出 Cua-S1-4B-0.2,称其为首个在真实 computer-use 任务上用 RLOO 强化学习训练的多模态决策模型,以任务完成为奖励信号。文本与多模态适配器均已以 Apache-2.0 开源,并已上线 Hugging Face Space,可在浏览器中选示例、看模型如何给候选操作打分。
所属事件:Cua 发布首个真实任务强化学习训练的计算机决策模型(2 条相关)→
「编程与Agent」频道最新
- 开发者用 Jev 打造自主角色村庄,称可用于机器人实时决策 — claud_fuen · 2026-09-24
- 用 Muse 智能体两天:自动播客、配音书籍、投资分析还谈成两单生意 — armand_ruiz · 2026-09-24
- 写 API 集成前先让 Agent 找出文档没写清的地方,一个提示词管用 — gethackteam · 2026-09-24
- 模型总按串行人力估时?开发者寻找让 Agent 学会并行的提示技巧 — ColleenMBrady · 2026-09-24
- GraphRAG 对比向量 RAG:图结构检索是增强还是过度工程? — adnan_hashmi · 2026-09-24
- AI2 再评估 Harness Evolution:自进化 Agent 只是多试了几次? — jiqizhixin · 2026-09-24