Chollet 驳斥满分 Agent:仅跑通公开简单测试集

fchollet · x · 2026-09-01

François Chollet 回复了关于某编码 Agent 在 ARC-AGI-3 上获得 100% 分数的争论。他指出,ARC-AGI-3 论文早在 3 月就说明公开评估集是“易于人类和 AI、更注重清晰度和趣味性”的演示环境,并不代表真正的智能水平。他反驳了对方关于“评估集也是有效基准”的辩护,强调在这些简单测试集上刷分并不等同于掌握了任务,并批评对方试图通过贬低公开测试集的重要性来掩盖缺乏私有数据验证的事实。

所属事件:ARC-AGI-3 满分宣传遭 Chollet 质疑(6 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →