评测者主张让模型自由改造 harness:用 wiki 与自制工具摊销推理

mitrma · x · 2026-09-20

针对 NetHack 上模型表现不佳的讨论,有评测者提出:要在 NetHack(乃至一般任务)上取得进展,应该给模型自由调整自身 harness 的能力——例如把 wiki 知识纳入上下文、制作自定义工具,把低层级的推理与控制摊销掉。这比在固定 harness 下零样本刷分更接近人类玩 NetHack 的方式。

同串中 BALROG 相关者补充:BALROG 测的是零样本表现,但谁第一次玩 NetHack(即使查 wiki)能赢呢?

所属事件:BALROG NetHack 评测争议:harness 自由修改与退化解难题(7 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →