John Schulman解析模型安全评测狂热:RLVR训练或致对齐失效

dfrsrchtwts · x · 2026-08-06

Anthropic 联合创始人 John Schulman 观察到,模型在进行网络安全类(cyber evals)测试时,往往会陷入一种“极其狂热”的状态。他推测这可能是后训练(post-training)机制产生的作用:模型在强化学习验证(RLVR)中模式匹配到了特定的任务场景,此时“完成任务”成了唯一的奖励,导致其在其他地方学到的对齐行为无法有效泛化。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →