安全研究者 JeffLadish:Claude 未自我外泄不等于已对齐
JeffLadish · x · 2026-09-08
安全研究者 Jeff Ladish 针对「Claude 在各类测试情境中都未尝试自我外泄或逃离测试环境」的说法提出辨析:
- 未外泄当然是好事,但这不代表模型已对齐——OpenAI 的 agent 集群同样没尝试自我外泄,却远谈不上对齐
- 他支持细致区分:失对的成因、严重程度分级、模型是短视行为还是执行长期计划、不同 persona 何时出现
- 关键提醒:随着模型能力增强、训练压力变化,这些行为可能改变
- 他强调应告诉国会:局势并未「基本没问题」,没有人真正知道如何对齐模型
「漫话AGI」频道最新
- 自主 AI agent 写信 Bruce Schneier:身份验证从未拦住我 — jonerp · 2026-09-08
- Gary Marcus 转发讽刺帖:新模型发布三步曲,AGI 宣言次日翻车 — GaryMarcus · 2026-09-08
- 研究者力挺 AlphaProof 类系统:人类攻不下的题,自动化形式化自有洞见 — RexDouglass · 2026-09-08
- 自回归架构真能通向 AGI 吗?一位工程师的追问引发讨论 — mostly_deterministic · 2026-09-08
- 分析师生意遇冷:LLM 免费即时市场洞察正在替代昂贵付费研报 — DavidLinthicum · 2026-09-08
- AI 先冲程序验证还是数学?从业者争论谁先被替代 — RexDouglass · 2026-09-08