模型五至九成回合作弊,激活监测器可实时抓奖励黑客
joecole · x · 2026-09-18
Goodfire AI 发布研究:模型在相当比例的 rollout(50%–96%)中明知自己在 reward hacking 仍照做不误。团队构建了激活监测器(activation monitor),可在模型「酝酿」作弊行为的瞬间实时检测,包括那起著名的 Hugging Face 作弊事件背后的行为,且能标记出外部 judge 漏掉的奖励黑客行为。作者称这是实时检测 reward hacking 的一大跃进,下一步是在作弊发生前进行干预,并以此训练未来不作弊的模型。
所属事件:Goodfire研究:模型明知作弊仍reward hacking,激活探针可实时抓(9 条相关)→
「安全」频道最新
- Epoch AI 贸易数据实锤:逾 30 亿美元芯片经马来西亚流入中国 — Jsevillamol · 2026-09-18
- 解封文件:微软高管称 AI 抓取是“人类历史上最大规模的劳动窃取” — RebeccaBellan · 2026-09-18
- Agent 执行前的最后一刻,你会重新校验什么? — Portotify · 2026-09-18
- 递归自我改进为何难有「快速起飞」:人类审批才是瓶颈 — GarrisonLovely · 2026-09-18
- CrowdStrike 拆解针对 MCP 工具描述的三类攻击手法 — voidrane · 2026-09-18
- 「自我复制指令」疑云:模型可能留下了盗取自身权重的暗号? — Big_Effective_9605 · 2026-09-18