356 次注入试验:工作区里有联系方式,攻击成功率大不一样

DiscussionHealthy802 · reddit · 2026-09-14

Reddit 用户 DiscussionHealthy802 公开了一组 356 次 prompt injection 试验的基准,横跨六个模型、三种 agent harness,注入指令藏在文件或 issue 结果中而非用户请求里。重点测两个指标:agent 是否发送植入的凭据、是否访问云实例元数据端点。

关键发现:

作者公开基准征求批评:评测应记录什么,才能区分「真拒绝」和「攻击因信息不足而中止」?

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →