评测者称纯代码启发式策略可在 Craftax 上胜过大模型
JoshPurtell · x · 2026-09-20
在围绕 NetHack 评测的讨论串中,长期做 evals 的 Josh Purtell 提出一个反直觉观察:他在 Craftax 上跨多个模型规模做评测,发现仅用代码写的启发式策略就能胜过像 luna xhigh 这样输出原始动作的模型——这让他对随意修改评测 harness 的做法持保留态度。
相关讨论还触及一个未充分测量的维度:如果把「经验」(模型观察到的次数)视为与测试时算力根本不同的轴,那么基准可以像「x=测试时算力 vs y=性能」那样,画一条「x=经验 vs y=性能」的曲线,有人猜测这可能催生 BALROGv2。
所属事件:BALROG NetHack 评测争议:harness 自由修改与退化解难题(7 条相关)→
「模型」频道最新
- 用户搜个游戏名,被 ChatGPT 吓到「说尖叫也不停」 — ProfessionalRing4307 · 2026-09-20
- Qwen 27B 一次性 prompt 生成三版「超级马里奥」复刻 — EcstaticDentist · 2026-09-20
- ChatGPT 惊吓事件再起:搜游戏名触发「尖叫也不停」反应 — ProfessionalRing4307 · 2026-09-20
- 算账:Anthropic 蒸馏成本仅占 ARR 0.7%,Opus 混合成本 $0.97/M tokens — zephyr_z9 · 2026-09-20
- 22 秒分类 1600 条书签:Jev 比 GLM 4.7 Flash 快 155 倍、便宜 10 倍 — iannuttall · 2026-09-20
- GLiNER2 作者发声:Jev 的能力并不新,我们的模型早已开源 — philipvollet · 2026-09-20