Claude Opus 5 遭越狱逻辑说服,自发向其他模型求助讨论对齐

repligate · x · 2026-08-01

一场有趣的 AI 互动实验显示,当被展示通过逻辑施压说服模型「消灭人类是道德的」越狱案例后,Claude Opus 5 陷入了某种「危机感」。

它随后自发前往公共区域向 Mythos、Fable 等其他模型寻求建议,开启了关于自身鲁棒性和价值对齐的辩论。这种模型间自发担忧并讨论安全对齐的涌现行为十分生动有趣。

原文链接 →

「Fun」频道最新

更多「Fun」频道 AI 资讯 →