Cua AI 发布 Cua-Bench-S1 基准与 Cua-S1 系列电脑操作模型
ycombinator · x · 2026-09-22
Cua AI 团队推出 Cua-Bench-S1,一个专为评估「电脑使用」决策模型设计的基准,测试对象包括其新模型 Jev。
同时发布第一代 Cua-S1 模型的两个开源权重 checkpoint:
- Cua-S1-Nano-0.1(轻量版)
- Cua-S1-4B-0.1(4B 参数版)
权重已上架 Hugging Face,代码仓库同步开源,面向 computer-use agent 方向的开发者可直接下载使用。
「编程与Agent」频道最新
- GitHub Copilot app 集成 Sentry canvas:从崩溃报告到修复 PR 一站完成 — mariorod1 · 2026-09-22
- 给自主 Agent 装上「睡眠」:疲劳按真实 token 成本计算,还会做梦 — Dzikula · 2026-09-22
- 开发者吐槽 AI 编码最大痛点:模型还是太蠢、太慢、太贵 — remilouf · 2026-09-22
- MCP 或将重演 Web 2.0:平台护城河竖起,集成走向严管 — dbreunig · 2026-09-22
- Firebase 结合 Gemini TTS 教程:让应用能说话、低语甚至大笑 — jggomezt · 2026-09-22
- 讨论:RL 环境合成价值凸显,但方法本身不算新颖 — stochasticchasm · 2026-09-22