一个以 AGI 命名的 benchmark,可能注定会被针对性优化
JasonBotterill · x · 2026-07-27
这条回复认为:把一个 benchmark 直接命名成 AGI,几乎注定会让实验室去针对它优化。
- 观点核心是 benchmark 的命名和设定,会反过来影响模型训练方向。
- 同时也再次强调:刷 benchmark 不等于真正接近 AGI。
所属事件:Opus 5 刷爆 ARC-AGI-3 引发热议与造假质疑(11 条相关)→
「模型」频道最新
- Claude Opus 5 一次生成通过滑雪者测试 — rohanpaul_ai · 2026-07-27
- GPT 5.6 Pro 被指比 Work/Codex 高档位更强 — latticecut · 2026-07-27
- 开发者称 Codex 已成自己在 ChatGPT 里的编程环境 — kevinkern · 2026-07-27
- Looped Transformer 从头训练更优,两次 pass 最划算 — jm_alexia · 2026-07-27
- Nebius 为明天的 Kimi 发布做准备,招聘影响更大 — demian_ai · 2026-07-27
- Claude Opus 5 在 VoxelBench 排第三,距第一仅差 30 Elo — legit_api · 2026-07-27