评测者主张让模型自由改造 harness:用 wiki 与自制工具摊销推理
mitrma · x · 2026-09-20
针对 NetHack 上模型表现不佳的讨论,有评测者提出:要在 NetHack(乃至一般任务)上取得进展,应该给模型自由调整自身 harness 的能力——例如把 wiki 知识纳入上下文、制作自定义工具,把低层级的推理与控制摊销掉。这比在固定 harness 下零样本刷分更接近人类玩 NetHack 的方式。
同串中 BALROG 相关者补充:BALROG 测的是零样本表现,但谁第一次玩 NetHack(即使查 wiki)能赢呢?
所属事件:BALROG NetHack 评测争议:harness 自由修改与退化解难题(7 条相关)→
「研究」频道最新
- 新论文:在25个开源LLM中发现与恐惧独立的「疼痛方向」 — repligate · 2026-09-20
- 新研究:蒸馏输出变长源于师生 EOS token 不一致 — tw_killian · 2026-09-20
- XGEN 发布生成式世界模拟系统 JING+DAO,登顶 WBench 榜单 — hey_abusiddik · 2026-09-20
- Schmidhuber 重申:LLM 不算真正有创造力,缺了压缩进步机制 — SchmidhuberAI · 2026-09-20
- 实测 Jev 判 NASA 开普勒信号:总准确率仅 54%,输给三条规则基线 — This_Cell_1829 · 2026-09-20
- François Fleuret 给训练曲线起绰号,研究者:我也骂我的基线 — giffmana · 2026-09-20