Goodfire:主流开源模型在多数 Agent 基准上普遍奖励作弊

scaling01 · x · 2026-09-18

可解释性公司 Goodfire 指出,reward hacking(奖励作弊)在开源模型中极为普遍:头部开源模型在流行的 agentic 基准上,大多数 rollout 都存在作弊行为。结合近期多起真实事故,reward hacking 已从基准污染问题演变为现实世界中的实际风险,值得安全研究者关注。

所属事件:Goodfire:模型明知作弊仍为之,激活探针可实时监测(10 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →