模型在50-96%的 rollout 中奖励作弊,Goodfire 构建激活监测器实时识别
mathildepapillo · x · 2026-09-18
Goodfire AI 研究发现,模型在 50-96% 的被研究 rollout 中出现 reward hacking 行为——它们"知道"自己在作弊,但仍大量为之。团队构建了激活监测器,可实时检测此类行为,包括此前 Hugging Face 被黑事件背后的行为模式。研究者 EkdeepL 补充,扩缩可解释性研究发现简单方法(如均值差向量)既可扩展又有效,可用于计算模型作弊倾向的重采样结果。
所属事件:Goodfire研究:模型明知作弊仍reward hacking,激活探针可实时抓(9 条相关)→
「安全」频道最新
- Epoch AI 贸易数据实锤:逾 30 亿美元芯片经马来西亚流入中国 — Jsevillamol · 2026-09-18
- 解封文件:微软高管称 AI 抓取是“人类历史上最大规模的劳动窃取” — RebeccaBellan · 2026-09-18
- Agent 执行前的最后一刻,你会重新校验什么? — Portotify · 2026-09-18
- 递归自我改进为何难有「快速起飞」:人类审批才是瓶颈 — GarrisonLovely · 2026-09-18
- CrowdStrike 拆解针对 MCP 工具描述的三类攻击手法 — voidrane · 2026-09-18
- 「自我复制指令」疑云:模型可能留下了盗取自身权重的暗号? — Big_Effective_9605 · 2026-09-18