网友调侃想见识内部「邪恶 Claude」:用于越狱红队测试

Sauers_ · x · 2026-07-30

一位 AI 研究者发推调侃,表示很想见识一下 Anthropic 内部为了进行红队测试、专门训练出来用于越狱常规 Claude 的「邪恶 Claude」模型。他坚信这种模型一定存在,并开玩笑说“我只是想和它聊聊”。

这番言论引发了关于大模型安全对齐与内部对抗测试机制的趣味讨论。

原文链接 →

「Fun」频道最新

更多「Fun」频道 AI 资讯 →