NVIDIA 发布 OSWorld-Pro:2800+ 子目标过程化评测,Claude Opus 5 仅 75.7%
nvidia · hf · 2026-10-06
- 现有计算机使用智能体(CUA)评测(如 OSWorld)只看最终交付物并用功能验证器打分,无法揭示智能体如何以及为何失败。
- OSWorld-Pro 提供 300+ 任务、2800+ 子目标,基于 67,000+ 条人工标注,用与人类对齐的 LLM-Judge 评估顺序依赖子目标的完成度,实现过程化评测。
- 关键结果:该基准对最先进 LLM 也很难,Claude Opus 5 在 OSWorld 上达 83.4%,在 OSWorld-Pro 上仅 75.7%。
- 分析揭示各模型的过程级失败模式(如与子目标无关的动作、点击类失误),为针对性改进 CUA 性能与效率提供洞察。
「研究」频道最新
- tszzl:对齐要成为工程学科,起码得先攻克机制可解释性 — tszzl · 2026-10-06
- 因果决策研究亮相可信 AI 研讨会,录像已公开 — murat_kocaoglu_ · 2026-10-06
- Claude 突破 3SUM 复杂度下界,给出 O(n^1.9992) 算法附 Lean 证明 — thegautamkamath · 2026-10-06
- ReSteer 开源:修复 VLA 执行中途无视新指令的可控性缺陷 — siddkaramcheti · 2026-10-06
- 研究者携「推理模型潜空间策略状态」解读工作参加 COLM — hunarbatra · 2026-10-06
- COLM 2026 论文:推理微调会在 LLM 潜空间中留下持久策略状态 — hunarbatra · 2026-10-06