评测者称纯代码启发式策略可在 Craftax 上胜过大模型

JoshPurtell · x · 2026-09-20

在围绕 NetHack 评测的讨论串中,长期做 evals 的 Josh Purtell 提出一个反直觉观察:他在 Craftax 上跨多个模型规模做评测,发现仅用代码写的启发式策略就能胜过像 luna xhigh 这样输出原始动作的模型——这让他对随意修改评测 harness 的做法持保留态度。

相关讨论还触及一个未充分测量的维度:如果把「经验」(模型观察到的次数)视为与测试时算力根本不同的轴,那么基准可以像「x=测试时算力 vs y=性能」那样,画一条「x=经验 vs y=性能」的曲线,有人猜测这可能催生 BALROGv2。

所属事件:BALROG NetHack 评测争议:harness 自由修改与退化解难题(7 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →