NetHack 评测争论:该让模型自由改造自己的 agent harness 吗
creus_roger · x · 2026-09-19
围绕 BALROG/NetHack 评测结果,作者 creusroger 提出核心观点:要让 agent 在 NetHack 这类长程任务上取得实质进展,应该允许模型相当自由地调整自己的 harness——例如把 wiki 知识吸收进上下文、创建自定义工具来摊销底层推理与控制开销。
回复中有人质疑新结果比上周差,猜测是 BALROG 只测 zero-shot;作者认为这类似于「谁第一次玩 NetHack 就能通关」的问题,说明评测口径本身值得商榷。
所属事件:BALROG NetHack 评测争议:harness 自由修改与退化解难题(7 条相关)→
「编程与Agent」频道最新
- 开发者用 SwiftUI 把折叠屏 iPhone 变成手风琴,铰链就是风箱 — rounak · 2026-09-20
- 从装 brew 到裸机自配:AI Agent 环境搭建已彻底变化 — vivekhaldar · 2026-09-20
- DiffusionGemma 被改造成本地 System One 快速决策模型,接入 vLLM — solyarisoftware · 2026-09-20
- Devin 新模型 SWE 2 免费无限用,自称基于 Kimi K3 后训练 — silasalberti · 2026-09-20
- 开发者用 Claude 审查 200 个图像聚类,揪出 3 个坏簇 — jamievurnilla · 2026-09-20
- 用语义替代正则:开发者开源「按含义搜索」的 semgrep,跨语言毫秒级匹配 — udmrzn · 2026-09-20