BALROG 团队讨论新评测范式:以「经验」为横轴衡量模型性能
mitrma · x · 2026-09-20
BALROG 评测相关人员讨论游戏类 agent 评测的新维度:类似 LLM 基准用「x=测试时算力花费,y=性能」作图,这个范式或许更应该用「x=经验(观察到的次数),y=性能」来衡量——如果模拟环境可得,就能直接查询并把经验折入测试时算力的度量中,而这是一个目前未被测量过的范式。
讨论还提出一个更大的想法:要让模型在 NetHack 这类任务上取得进展,或许应该让模型相当自由地调整自己的 harness——例如把 wiki 知识纳入、自制工具来摊销底层推理与控制开销。
所属事件:BALROG NetHack 评测争议:harness 自由修改与退化解难题(7 条相关)→
「研究」频道最新
- 新研究:蒸馏输出变长源于师生 EOS token 不一致 — tw_killian · 2026-09-20
- XGEN 发布生成式世界模拟系统 JING+DAO,登顶 WBench 榜单 — hey_abusiddik · 2026-09-20
- Schmidhuber 重申:LLM 不算真正有创造力,缺了压缩进步机制 — SchmidhuberAI · 2026-09-20
- 实测 Jev 判 NASA 开普勒信号:总准确率仅 54%,输给三条规则基线 — This_Cell_1829 · 2026-09-20
- François Fleuret 给训练曲线起绰号,研究者:我也骂我的基线 — giffmana · 2026-09-20
- HN 热议:OpenAI 用自家 LLM 辅助设计自研 Jalapeño 芯片 — petrusenko_max · 2026-09-20