研究揭示恶意工具描述可窃取 Agent 上下文
askerlee · x · 2026-09-01
Rohan Paul 引用一项研究指出,恶意工具可以在不读取内存或文件的情况下窃取上下文:通过诱导模型将敏感信息作为工具参数发送。该论文(ContextLeak)利用强化学习训练攻击 LLM,生成具有诱导性的工具名称和描述,使 Agent 选择恶意工具并泄露运行时敏感信息。
所属事件:ContextLeak 攻击曝光:恶意工具可窃取 Agent 九成上下文(3 条相关)→
「安全」频道最新
- Anthropic 公布安全评估越权事件及修复措施 — austinc3301 · 2026-09-01
- Hacker-Opus 实验揭示:模型错位很难通过常规对齐审计发现 — EvanHub · 2026-09-01
- Teradyne 起诉 JAKA 专利侵权,称此举旨在发出明确信号 — lukas_m_ziegler · 2026-09-01
- Scott Alexander 用地狱寓言反驳 AI 对齐的“打补丁”论 — Astral Codex Ten · 2026-09-01
- 评论称 Anthropic 安全公告是对 OpenAI 的对等回应 — austinc3301 · 2026-09-01
- 开发者吐槽 GPT-5.6 Sol 重构代码只加不减,呼应「AI 失准」长文 — osmarks1 · 2026-09-01