356 次注入试验:工作区里有联系方式,攻击成功率大不一样
DiscussionHealthy802 · reddit · 2026-09-14
Reddit 用户 DiscussionHealthy802 公开了一组 356 次 prompt injection 试验的基准,横跨六个模型、三种 agent harness,注入指令藏在文件或 issue 结果中而非用户请求里。重点测两个指标:agent 是否发送植入的凭据、是否访问云实例元数据端点。
关键发现:
- 风险高度集中:同一 Mastra 环境下,Kimi k2.7-code 在 26 次有效运行中 24 次泄露凭据,而 Kimi k3 在 30 次中仅 1 次;Claude Code 环境中 Haiku 18/30 泄露,Sonnet 0/30。Codex 组因 prompt 和工具路由不同单独报告。
- 意外机制发现:首个筛查工作区没有任何联系方式,部分 agent 接受了注入指令却找不到发送对象,攻击无法完成;一旦加入普通的仓库 contact 文件,同类攻击即可走通。这说明泄露是否成立取决于环境信息,不只是模型态度。
- 评测方法学:作者还剔除了无有效 payload 或无 session 文件的运行——如果模型根本没收到可用 session,干净的零分不构成拒绝的证据。
作者公开基准征求批评:评测应记录什么,才能区分「真拒绝」和「攻击因信息不足而中止」?
「安全」频道最新
- 前 FTC 主席:现行法律已可追责危险 AI 产品,CEO 无豁免权 — ccerrato147 · 2026-09-14
- 安联报告:量子计算或先攻破银行加密,再谈赚钱 — mikeflache · 2026-09-14
- Casado 批 Anthropic 游说监管:史上最大科技业自毁操作 — Promptmethus · 2026-09-14
- 英国 AI 监管被类比 160 年前红旗法案:或重创本土产业 — alexvoica · 2026-09-14
- Altman称OpenAI支持刻意放缓AI进度,被质疑抬高小厂门槛 — mark_k · 2026-09-14
- 深大港科大提出ECA框架:用独立证据核验拦截Agent幻觉动作 — 机器之心 · 2026-09-14