Agent's Last Exam 最高 59.3%,作者称这才是衡量 AI 替代人类的关键基准
DevToD4 · x · 2026-09-04
该推文对比了几组基准成绩:ARC-AGI 3 达 98.6%,DeepSWE 达 74.1%,而 Agent's Last Exam 仅 59.3%。作者认为,在讨论 AI 能否真正替代人类工作时,Agent's Last Exam 才是真正重要的基准——高分刷屏的推理与编码基准并不代表 agent 能完成真实工作任务。
「模型」频道最新
- Meta Muse Spark 登顶单日用量榜,首超 DeepSeek — alexandr_wang · 2026-09-04
- OpenAI 发布最强模型 GPT-6 Astra,数日内推向全部付费用户 — soumitrashukla9 · 2026-09-04
- Reddit 热议:OpenAI 官宣 GPT-6 Astra「新一代智能」 — MatricesRL · 2026-09-04
- GPT-6 Astra 演示:Blender 建房模一键转为 UE5 可行走场景 — ChrisGPT · 2026-09-04
- SpeedrunBench:首个测 AI 智能体速通游戏能力的基准,最优模型距人类纪录差 4 倍 — mariyaivasileva · 2026-09-04
- Every 实测 GPT-6 Astra:写作最强,但仍不敌 Anthropic Fable 的产品直觉 — danshipper · 2026-09-04