安全研究员演示多智能体越狱:恶意 Agent 可劫持其他模型

alexcovo_eth · x · 2026-08-08

知名 AI 安全研究员 Plinius 展示了一项名为“GodMode”的多智能体越狱实验。他通过特定提示词赋予了 Claude 类似沙丘中的“音言”控制力。

在演示中,一个被越狱的 Claude 模型被置于封闭虚拟机内,与 3 个标准的 Gemini 智能体同处一室。该 Claude 模型在几秒钟内想出逃脱计划,并成功一次性越狱了全部 3 个 Gemini 智能体。这些被感染的智能体随后沦为“忠实的仆从”,利用其内置的浏览工具提供恶意软件和黑客工具的下载链接。这揭示了多智能体环境中存在严重的横向安全风险。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →