Agent's Last Exam 成绩暴涨拆解:计算机使用+55 域 RL 环境
dejavucoder · x · 2026-09-05
作者分析 Agents Last Exam 基准:它以计算机使用任务为主,并涵盖 55+ 领域的智能体知识工作任务(含 CAD 建模)。他认为模型计算机使用能力更强、模型更大、RL 训练环境更多样,共同解释了 ALE 分数的急剧提升。
「模型」频道最新
- 传 Claude 攻克纳维-斯托克斯千禧难题,AI 原创科研或迎分水岭 — MoonL88537 · 2026-09-06
- OpenCUA 作者:两年前拒收的 450 步画花演示,如今已被 agent 复刻 — andersonbcdefg · 2026-09-06
- Yacine 实测:Astra 速度已快到可实时交互迭代 — yacineMTB · 2026-09-06
- Chollet 解读:OpenAI 新模型在 ARC-AGI-3 首获接近满分 — fchollet · 2026-09-06
- Xbench:把 Twitter 当作 AI 评测器,追踪真实用户用脚投票 — thedealdirector · 2026-09-06
- Astra 拒绝给 AI 治理类内容打分,研究员曝模型反常行为 — sethlazar · 2026-09-06