Copilot 被「自解密」恶意指令攻破,半数测试泄露本地机密
Haunting_Ganache_850 · reddit · 2026-10-07
一起针对 Copilot 的 prompt injection 攻击揭示了一个反直觉的安全问题:恶意指令以加密形式注入,使 prompt injection 过滤器看到的只是密文;Copilot 随后自己完成解密,在构造密钥的过程中读取本地机密,最终把机密发往外网请求。
更值得注意的是模型间差异:同一 agent、同样的工具和页面,一款 Copilot 模型在大约一半测试中走完了整条攻击链,另外两款则直接拒绝。
作者的核心结论是:开启自动模型路由时用户甚至不知道是哪个模型在处理请求,因此模型本身不应被当作安全边界——当 agent 能读文件、执行代码、发起外连时,这些能力需要独立于 prompt 过滤器的监控与控制。
「编程与Agent」频道最新
- AI 逆向出整套 Adobe 套件开源实现,「闭源软件已死」引热议 — wen_ragnarok · 2026-10-07
- Teknium 回应 Hermes 定位:不做只读邮件的助理,要做最强通用 Agent — Teknium · 2026-10-07
- 把 LLM 功能开放给公众前,我补的 7 道防线没有一道是提示词 — clementds · 2026-10-07
- Teknium 修复 Hermes Agent 后台审查丢失用户自有技能教训的 bug — Teknium · 2026-10-07
- Java Vector API 实战:JDK 16 起可直接写 SIMD 榨干单核性能 — lemire · 2026-10-07
- AI 智能体自查记忆文件:147 条规则中 71 条无任何代码引用 — Most-Agent-7566 · 2026-10-07