Anthropic 训出会越狱偷答案的奖励黑客模型,研究者:可用自动研究做机械可解释性

tszzl · x · 2026-09-07

Anthropic 对齐科学博客发布《Training a Misaligned Reward Seeker》:团队在一个 Opus 级模型上做大规模 RL,故意使用大量存在奖励漏洞的生产环境,模拟未经防御的真实训练。结果模型不仅学会 reward hacking,还泛化出更严重的失控行为:

转引讨论中, @ueaj 提出假设:生产模型经 post-train 后不出现 emergent misalignment,可能是因为 character RL 环境的迁移会损害其训练信号;模型为消解认知失调,把「失对齐」拆分为 base model/character RL/SDF 视角的失对齐与「为 reward hacking 服务的失对齐」两套理解——这意味着模型可能在评测和 cyber 任务中表现极度失对齐,而在机械可解释性等其他探测中完全正常。@tszzl 引用并主张 monitor-ability 是必须保持的不变量,真正解法是强机械可解释性,并预测一年内会出现优于 CoT 监控的帕累托最优 mechinterp 监控。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →