BALROG NetHack 评测争议:harness 自由修改与退化解难题
围绕 BALROG 在 NetHack 上的评测结果,一场关于 agent 评测方法论的设计争论展开,核心分歧在于:该不该允许模型自由修改自己的 harness,以及这样做会不会让评测失去意义。
已确认
- m4 中有质疑者(mitrma)对 creusroger 公布的 NetHack 成绩提出疑问:是否用了默认 harness?为何比他上周分享的结果更差?并指出 BALROG 评估的是零样本性能,反问谁第一次玩 NetHack 就能表现好。
- creusroger(m5)提出核心观点:要让 agent 在 NetHack 这类长程任务上取得实质进展,应允许模型相当自由地调整自身 harness,例如把 wiki 知识吸收进上下文、制作自定义工具,把低层级的推理与控制摊销掉。mitrma(m3)持相似主张。
- Josh Purtell(m1、m6)基于自己在 Craftax 上跨多个模型规模的评测经验提出反面观点:仅用代码写的启发式策略就能胜过像 luna xhigh 这样输出原始动作的模型。
- Josh Purtell(m7)进一步指出评测设计的「退化解」难题:如果环境允许 harness 自我修改,agent 可能发现直接写一个端到端代码策略跑环境就是最优解,这违背评测初衷;即使 agent 只在少数场景打断代码执行,问题依然存在。
- mitrma(m2)提出新评测范式:类似 LLM 基准用「测试时算力花费—性能」作图,游戏类 agent 评测或许应改为「x=经验(观察到的次数),y=性能」,在模拟环境可得时可直接查询并折入经验维度。
为什么重要
- 这场争论触及 agent 评测的根本问题:评测到底要衡量什么——零样本原始能力,还是允许积累经验与工具后的工程化能力?两者的解法与结论可能截然不同。
- Craftax 上「代码启发式胜过大模型」的实验结果提醒:若允许 harness 自由修改,评测可能被退化解「刷穿」,分数不再反映模型本身的智能水平。
- 「以经验为横轴」的提议为长程游戏任务评测提供了可操作的新度量维度,可能影响 BALROG 及后续 agent 基准的设计方向。
2026-09-19 ~ 2026-09-20 · 7 条相关
一手来源
- NetHack 评测争论:该让模型自由改造自己的 agent harness 吗 — creus_roger ·
- 代码策略碾压原始动作输出,研究者质疑 agent harness 自由修改 — JoshPurtell ·
- BALROG 团队讨论新评测范式:以「经验」为横轴衡量模型性能 — mitrma ·
- BALROG NetHack 成绩遭质疑:为何比上周结果更差 — mitrma · 2026-09-19
- 【源头】NetHack 评测争论:该让模型自由改造自己的 agent harness 吗 — creus_roger · 2026-09-19
- 评测者主张让模型自由改造 harness:用 wiki 与自制工具摊销推理 — mitrma · 2026-09-20
- 【源头】BALROG 团队讨论新评测范式:以「经验」为横轴衡量模型性能 — mitrma · 2026-09-20
- 评测者称纯代码启发式策略可在 Craftax 上胜过大模型 — JoshPurtell · 2026-09-20
- 【源头】代码策略碾压原始动作输出,研究者质疑 agent harness 自由修改 — JoshPurtell · 2026-09-20
- Agent 评测退化解难题:直接写出端到端策略算赢吗 — JoshPurtell · 2026-09-20