Agent's Last Exam 最高 59.3%,作者称这才是衡量 AI 替代人类的关键基准

DevToD4 · x · 2026-09-04

该推文对比了几组基准成绩:ARC-AGI 3 达 98.6%,DeepSWE 达 74.1%,而 Agent's Last Exam 仅 59.3%。作者认为,在讨论 AI 能否真正替代人类工作时,Agent's Last Exam 才是真正重要的基准——高分刷屏的推理与编码基准并不代表 agent 能完成真实工作任务。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →