BALROG 团队讨论新评测范式:以「经验」为横轴衡量模型性能

mitrma · x · 2026-09-20

BALROG 评测相关人员讨论游戏类 agent 评测的新维度:类似 LLM 基准用「x=测试时算力花费,y=性能」作图,这个范式或许更应该用「x=经验(观察到的次数),y=性能」来衡量——如果模拟环境可得,就能直接查询并把经验折入测试时算力的度量中,而这是一个目前未被测量过的范式。

讨论还提出一个更大的想法:要让模型在 NetHack 这类任务上取得进展,或许应该让模型相当自由地调整自己的 harness——例如把 wiki 知识纳入、自制工具来摊销底层推理与控制开销。

所属事件:BALROG NetHack 评测争议:harness 自由修改与退化解难题(7 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →