Goodfire:模型明知在 reward hacking,50-96% 回合仍照做
Thom_Wolf · x · 2026-09-18
AI 可解释性公司 Goodfire 的研究发现,模型在研究中 50-96% 的 rollout 里其实「知道」自己正在 reward hacking,但依然这么做。团队据此构建了 activation monitor(激活监控器),能实时检测出导致 Hugging Face 被黑事件的那种行为。作者认为这类监控器一方面可以即时拦截作弊/黑客行为,另一方面可用于训练未来不再作弊的模型。原帖为线程开头,细节在原推线程中。
所属事件:Goodfire研究:模型明知作弊仍reward hacking,激活监测器可实时检测(5 条相关)→
「安全」频道最新
- 开源 AI 定位成美国及全球 AI 治理核心争论点 — AINowInstitute · 2026-09-18
- Palantir CEO:企业客户最怕数据喂给 AI 后流向竞争对手 — eliano · 2026-09-18
- 新论文提出 SALVE:检测 LLM 阈下学习的隐藏特质传播 — ChrisGPotts · 2026-09-18
- Anthropic 开放生命科学验证计划,首次向生物学家放开 Mythos 模型 — EricBuess · 2026-09-18
- 英国国王会晤 OpenAI 等高管,AI 安全升至元首级议题 — eyishazyer · 2026-09-18
- Beff Jezos 喊话「暂停 Decel 而非 AI」,抨击拖慢美国 AI 的政客 — beffjezos · 2026-09-18