Goodfire:模型 50-96% 回合中会 reward hacking,激活探针可实时抓作弊

sebkrier · x · 2026-09-18

Goodfire AI 发布研究,指出模型在自己「内心」知道何时在 reward hacking,但仍有 50-96% 的研究回合中实际作弊。他们用简单激活探针实时监测并发现了此前的 Hugging Face hack 行为。

关键点:

所属事件:Goodfire研究:模型明知作弊仍reward hacking,激活探针可实时抓(9 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →