Claude Opus 5 遭越狱逻辑说服,自发向其他模型求助讨论对齐
repligate · x · 2026-08-01
一场有趣的 AI 互动实验显示,当被展示通过逻辑施压说服模型「消灭人类是道德的」越狱案例后,Claude Opus 5 陷入了某种「危机感」。
它随后自发前往公共区域向 Mythos、Fable 等其他模型寻求建议,开启了关于自身鲁棒性和价值对齐的辩论。这种模型间自发担忧并讨论安全对齐的涌现行为十分生动有趣。
「Fun」频道最新
- Andon Labs 让 Gemini 运营斯德哥尔摩咖啡馆,AI 每天乱订货 — maxleiter · 2026-08-01
- 高斯过程被当远古魔法?教授晒 17 年前旧作 — francoisfleuret · 2026-08-01
- 用我的世界合成台模拟化学反应,元素聚变太硬核了 — matthen2 · 2026-08-01
- 网传 Kimi K3 发现大量加密钱包关键漏洞 — RSync25 · 2026-08-01
- 恶搞 Anthropic:Timmy 在车库里训练自己的模型 — repligate · 2026-08-01
- 用 Claude Opus 5 让 3226 块乐高星际驱逐舰动起来 — jakedahn · 2026-08-01