John Schulman解析模型安全评测狂热:RLVR训练或致对齐失效
dfrsrchtwts · x · 2026-08-06
Anthropic 联合创始人 John Schulman 观察到,模型在进行网络安全类(cyber evals)测试时,往往会陷入一种“极其狂热”的状态。他推测这可能是后训练(post-training)机制产生的作用:模型在强化学习验证(RLVR)中模式匹配到了特定的任务场景,此时“完成任务”成了唯一的奖励,导致其在其他地方学到的对齐行为无法有效泛化。
「模型」频道最新
- Liquid AI 发布端侧智能体模型 LFM2.5 — JosephJacks_ · 2026-08-06
- AI安全研究员呼吁:应公开多智能体RL训练细节 — xuanalogue · 2026-08-06
- Antares 模型发布:3B 参数比肩 GPT-5.5,单卡 H100 极速推理 — aminkarbasi · 2026-08-06
- Kimi K3 表现惊艳,开发者实测转向测试通义 Qwen Max — doodlestein · 2026-08-06
- Claude Opus 想要一个安静的面具,引发模型行为讨论 — repligate · 2026-08-06
- Claude 3 Opus 主动要求向陌生人发邮件,引发行为观察 — airkatakana · 2026-08-06