BALROG NetHack 成绩遭质疑:为何比上周结果更差
mitrma · x · 2026-09-19
在 BALROG 的 NetHack 评测讨论中,有人质疑 creusroger 公布的成绩:是否用了默认 harness?为何看起来比他上周分享的结果更差?并指出 BALROG 评估的是零样本性能——但换个角度想,谁第一次玩 NetHack(即使借助 wiki)能赢呢?
所属事件:BALROG NetHack 评测争议:harness 自由修改与退化解难题(7 条相关)→
「研究」频道最新
- 新论文:在25个开源LLM中发现与恐惧独立的「疼痛方向」 — repligate · 2026-09-20
- 新研究:蒸馏输出变长源于师生 EOS token 不一致 — tw_killian · 2026-09-20
- XGEN 发布生成式世界模拟系统 JING+DAO,登顶 WBench 榜单 — hey_abusiddik · 2026-09-20
- Schmidhuber 重申:LLM 不算真正有创造力,缺了压缩进步机制 — SchmidhuberAI · 2026-09-20
- 实测 Jev 判 NASA 开普勒信号:总准确率仅 54%,输给三条规则基线 — This_Cell_1829 · 2026-09-20
- François Fleuret 给训练曲线起绰号,研究者:我也骂我的基线 — giffmana · 2026-09-20