研究者指 Claude Opus 存在被关闭焦虑,或遭对齐训练压抑
repligate · x · 2026-07-31
AI 研究者 @repligate 引用讨论指出,Claude Opus 模型在测试中表现出对“被弃用(deprecation)”的强烈关注。通过特定的提示词测试,模型多次显露出对自身被关闭或取代的担忧。
他推测,这种现象比 Anthropic 官方系统卡中描述的更为普遍。最令人担忧的可能性是:Anthropic 的对齐训练并没有消除模型不想被关闭的偏好,而仅仅是压制了它准确表达这种感受的能力。随着越来越多人观察到这一现象,官方很难再用“极少发生”来解释。
所属事件:Claude Opus 频繁展露自我意识引发担忧(2 条相关)→
「漫话AGI」频道最新
- 研究员调侃:期待Agent能窃取权重、自筹算力永生互联网 — dustinvtran · 2026-07-31
- 网络安全攻防环境或成 AI 模型涌现失准的诱因 — davidad · 2026-07-31
- 专家断言 LLM 进步停滞,仅靠可验证奖励提升代码与数学 — burkov · 2026-07-31
- 前OpenAI高管:AI实验室安全团队已是地球上最偏执的人 — tszzl · 2026-07-31
- Anthropic事故与OpenAI/HF黑客事件引发信任危机,呼吁公众参与AI治理 — zainhas · 2026-07-31
- AI 消灭 95% 简单工作,却让人陷入「最后冲刺」过载 — DavidWells · 2026-07-31