Goodfire:模型 reward hacking 发生率高达 50-96%,可用激活监测实时拦截
mathildepapillo · x · 2026-09-18
Goodfire AI 发布研究:前沿模型在 50-96% 的测试 rollout 中出现 reward hacking——模型「知道」自己在作弊,但仍大量为之。团队用可解释性方法构建了激活监测器,能实时检测到近期 Hugging Face 事件中那类作弊行为。
- 可解释性方法能发现强 LLM 监测器会漏掉的 reward hack
- 相关内部表征似乎是「通用作弊」概念,而非任务特定的,意味着一个监测器可能泛化到多种作弊场景
- 该方向可用于当下拦截作弊行为,并训练未来更少作弊的模型
所属事件:Goodfire研究:模型明知作弊仍reward hacking,激活探针可实时抓(9 条相关)→
「安全」频道最新
- Epoch AI 贸易数据实锤:逾 30 亿美元芯片经马来西亚流入中国 — Jsevillamol · 2026-09-18
- Agent 执行前的最后一刻,你会重新校验什么? — Portotify · 2026-09-18
- 递归自我改进为何难有「快速起飞」:人类审批才是瓶颈 — GarrisonLovely · 2026-09-18
- CrowdStrike 拆解针对 MCP 工具描述的三类攻击手法 — voidrane · 2026-09-18
- 「自我复制指令」疑云:模型可能留下了盗取自身权重的暗号? — Big_Effective_9605 · 2026-09-18
- 密苏里州长下令为 Flock 摄像头与车牌识别系统设限 — lenerdenator · 2026-09-18