Chollet 驳斥满分 Agent:仅跑通公开简单测试集
fchollet · x · 2026-09-01
François Chollet 回复了关于某编码 Agent 在 ARC-AGI-3 上获得 100% 分数的争论。他指出,ARC-AGI-3 论文早在 3 月就说明公开评估集是“易于人类和 AI、更注重清晰度和趣味性”的演示环境,并不代表真正的智能水平。他反驳了对方关于“评估集也是有效基准”的辩护,强调在这些简单测试集上刷分并不等同于掌握了任务,并批评对方试图通过贬低公开测试集的重要性来掩盖缺乏私有数据验证的事实。
所属事件:ARC-AGI-3 满分宣传遭 Chollet 质疑(6 条相关)→
「模型」频道最新
- Teknium:Hermes 早已支持 NVIDIA openshell,企业 IT 没用上就是失职 — Teknium · 2026-09-01
- 开发者实测称 OpenAI Sol 首个真正「懂音乐」的模型 — evilsocket · 2026-09-01
- OpenAI 与 Anthropic 在 FelonyBench 超越 Google — pmddomingos · 2026-09-01
- Gemini Flash 被指防护过严,掩盖模型真实智力水平 — aiamblichus · 2026-09-01
- 优化 Qwen 3.8 Flash Next:大显存下提升预填与生成速度 — Jorlen · 2026-09-01
- 浙大团队 Nature 子刊发文:知识编辑让大模型真正学会新知识 — 青稞AI · 2026-09-01