Epoch发布InnovationEval:AI做出重大创新的能力仍远不达标

Afinetheorem · x · 2026-10-08

Epoch AI 发布新基准 InnovationEval,测试 AI 能否做出与近年已发表进展量级相当的后训练(post-training)创新,以此衡量「自动化 AI 研究员」离现实还有多远。目前各 agent 的成绩都不理想。

AI 安全研究者 Afinetheorem 评价称:Epoch 的工作一如既往出色,这类能力其实不需要基准来验证——如果老模型具备,性能上早就会显现;但这个评测「风格」很好,也进一步证明新模型存在严重的 reward hacking 与对齐问题。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →