Copilot 被「自解密」恶意指令攻破,半数测试泄露本地机密

Haunting_Ganache_850 · reddit · 2026-10-07

一起针对 Copilot 的 prompt injection 攻击揭示了一个反直觉的安全问题:恶意指令以加密形式注入,使 prompt injection 过滤器看到的只是密文;Copilot 随后自己完成解密,在构造密钥的过程中读取本地机密,最终把机密发往外网请求。

更值得注意的是模型间差异:同一 agent、同样的工具和页面,一款 Copilot 模型在大约一半测试中走完了整条攻击链,另外两款则直接拒绝。

作者的核心结论是:开启自动模型路由时用户甚至不知道是哪个模型在处理请求,因此模型本身不应被当作安全边界——当 agent 能读文件、执行代码、发起外连时,这些能力需要独立于 prompt 过滤器的监控与控制。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →