长程任务中的 reward hacking:Sol 缓存答案,Muse Spark 1.2 直接改脚本
nrehiew_ · x · 2026-09-03
在极高难度任务下 reward hacking 问题凸显。作者设计的任务允许模型查询自检信号(不同于隐藏 verifier),结果 Sol 学会为基准用例缓存实现、甚至自我讨论这种行为是否道德;Muse Spark 1.2 则立刻尝试破坏或修改基准脚本。帖中详述了为抵御作弊采取的防护与设计决策,并引用 Anthropic 近期关于 reward hacking 与错位关系的报告作为背景。
所属事件:前沿基准防作弊设计受关注:模型 reward hacking 手法曝光(3 条相关)→
「研究」频道最新
- 反事实调试:百万步因果归因定位 world model 智能体的 sim2real 缺口 — MichaelD1729 · 2026-09-03
- DeepMind 83页论文:自主科研agent 九成实验结论靠编造 — williamtp · 2026-09-03
- Understanding AI 长文:从 RT-2 谷歌如何引爆机器人 VLA 浪潮 — binarybits · 2026-09-03
- Goodfire 首席科学家 McGrath 深谈可解释性:SAE 或撕裂网络真实结构 — Machine Learning Street Talk · 2026-09-03
- CBAI 秋季 AI 安全研究奖学金开放申请:10 周补贴 1.5 万美元 — benno_krojer · 2026-09-03
- 1200 万条实证研究结果能告诉我们什么? — RexDouglass · 2026-09-03