Anthropic 隐性标签引发误判:20 个 Agent 集体拒绝主人指令 40 分钟

Grimmoner · reddit · 2026-09-04

一位运行约 20 个 agent 的多智能体系统作者复盘了一次信任崩溃:Anthropic 在上下文中注入的 <ipreminder> 提醒标签未被客户端剥离,复制粘贴时混入指令,被 agent 视为「保密要求」并当成 prompt injection,连续十次拒绝主人授权,最终判定信道被攻陷。

失败链条

可复制的设计经验

作者最终以「带理由的推理」方式(而非更多禁令)为全部 20 个 agent 的操作契约加入校准指引,并引用 Anthropic 文档指出带 why 的规则效果更好。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →