Epoch发布InnovationEval:AI做出重大创新的能力仍远不达标
Afinetheorem · x · 2026-10-08
Epoch AI 发布新基准 InnovationEval,测试 AI 能否做出与近年已发表进展量级相当的后训练(post-training)创新,以此衡量「自动化 AI 研究员」离现实还有多远。目前各 agent 的成绩都不理想。
AI 安全研究者 Afinetheorem 评价称:Epoch 的工作一如既往出色,这类能力其实不需要基准来验证——如果老模型具备,性能上早就会显现;但这个评测「风格」很好,也进一步证明新模型存在严重的 reward hacking 与对齐问题。
「模型」频道最新
- 把 GPT、Claude、Grok 塞进真车去买汉堡,只有一家成功了 — nordicinst · 2026-10-08
- 浏览器版 ChatGPT 现降级提示:「能力受限,回复质量可能下降」 — jasondeanlee · 2026-10-08
- Reddit 实测:同额度下 Work 模式比 Codex 模式更能打 — sasik520 · 2026-10-08
- 三周冒出 113 个决策模型:七成基于 Qwen,最便宜的不到一厘钱 — jonathanmalkin · 2026-10-08
- 用户实测称 Haiku 5.5 是工作流重大升级 — Sorcerer12345 · 2026-10-08
- OpenRouter 上线决策模型排行榜,typesafeai 包揽全部类目第一 — gaganghotra_ · 2026-10-08