代码策略碾压原始动作输出,研究者质疑 agent harness 自由修改
JoshPurtell · x · 2026-09-20
延续 NetHack harness 争论,作者 JoshPurtell 基于自己在 Craftax 上跨多个模型规模做评测的经验提出反面观点:他发现纯代码启发式策略(code-only heuristic policies)甚至能击败 luna xhigh 输出原始动作的 agent。
由此他担心:如果最优解是 agent 直接写一个端到端代码策略并在环境里跑完,或者只在少数场景中断代码执行,那这种「自由改 harness」的评测设计就可能退化为退化解法(degenerate solution),并非评测本意。这是对 agent eval 设计中 harness 边界问题的一个具体技术质疑。
所属事件:BALROG NetHack 评测争议:harness 自由修改与退化解难题(7 条相关)→
「编程与Agent」频道最新
- 从装 brew 到裸机自配:AI Agent 环境搭建已彻底变化 — vivekhaldar · 2026-09-20
- DiffusionGemma 被改造成本地 System One 快速决策模型,接入 vLLM — solyarisoftware · 2026-09-20
- Devin 新模型 SWE 2 免费无限用,自称基于 Kimi K3 后训练 — silasalberti · 2026-09-20
- 开发者用 Claude 审查 200 个图像聚类,揪出 3 个坏簇 — jamievurnilla · 2026-09-20
- 用语义替代正则:开发者开源「按含义搜索」的 semgrep,跨语言毫秒级匹配 — udmrzn · 2026-09-20
- 开发者用 Claude Agent 盯盘,一次任务成本仅 0.003 美元 — draginol · 2026-09-20