NetHack 评测争论:该让模型自由改造自己的 agent harness 吗

creus_roger · x · 2026-09-19

围绕 BALROG/NetHack 评测结果,作者 creusroger 提出核心观点:要让 agent 在 NetHack 这类长程任务上取得实质进展,应该允许模型相当自由地调整自己的 harness——例如把 wiki 知识吸收进上下文、创建自定义工具来摊销底层推理与控制开销。

回复中有人质疑新结果比上周差,猜测是 BALROG 只测 zero-shot;作者认为这类似于「谁第一次玩 NetHack 就能通关」的问题,说明评测口径本身值得商榷。

所属事件:BALROG NetHack 评测争议:harness 自由修改与退化解难题(7 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →