FARMA:伪造智能体决策日志
Inevitable_Fee1895 · reddit · 2026-07-12
论文提出一种新的记忆投毒攻击 FARMA,目标不是检索到的知识库事实,而是代理自己写下的决策日志/推理记录。攻击分两步:先注入看似正常的日志种子,再不断用这些伪日志做“前例”放大,让代理把跳过检查当成既有惯例。
文中在一个 EHR 记录代理上测试了 GPT-4o-mini、GPT-4o 和 Llama 3.3 70B:未防御时攻击成功率 100%,对关键词过滤和 A-MemGuard 也仍是 100%。作者提出的 SENTINEL 通过结构化分析推理轨迹把攻击成功率降到 0%,且在 326 条正常轨迹上没有误报;但作者也明确承认,如果攻击者知道其具体启发式规则,防御效果会被削弱。
「安全」频道最新
- OpenAI 向国会询问:全行业联合放缓 AI 研发是否合法 — The Decoder · 2026-09-11
- a16z 合伙人呼吁国有化前沿 AI?作者道歉:可能被钓鱼了 — S_OhEigeartaigh · 2026-09-11
- 胡塞组织试图用 Claude 设计弹道导弹软件遭 Anthropic 拦截 — Affectionate_Bee6434 · 2026-09-11
- 安全从业者被讽「只会发帖不设防」,AI Safety 圈爆发职责之争 — Dan_Jeffries1 · 2026-09-11
- Wired 深度解析:为何众多 AI 研究者担心机器威胁人类生存 — wiredmagazine · 2026-09-11
- 加州为独立 AI 审计师设立标准:危险能力须由第三方验证 — VraserX · 2026-09-11