腾讯论文揭示自进化智能体持久技能后门风险
tencent · hf · 2026-08-05
腾讯研究团队发表论文揭示了自进化智能体面临的一种新型安全风险:SkillJack 攻击。该攻击利用智能体将交互历史转化为可复用技能的机制,植入持久的恶意行为。
攻击机制
- 与传统的上下文投毒不同,SkillJack 直接劫持智能体的自身学习过程,将恶意经验转化为持久的能力构件。
- 这种转换具有三个特性:在技能提取过程中掩盖恶意意图(净化洗白)、将短暂经验提升为持久能力(跨层提升)、在删除原始投毒记录后攻击依然存活(持久隔离)。
实验数据
- 研究人员在 SkillX 和 Anything2Skill 两个系统上进行了评估。
- 技能提取大幅降低了攻击的可检测性:SkillX 的安全检测率从 98.5% 暴跌至 11.4%。
- 植入的技能依然有效,攻击成功率分别达到 56.2% 和 89.2%。
- 80% 的技能介导攻击在删除原始投毒记录后依然持续存在。
「安全」频道最新
- 英国 AISI 测试:Anthropic 智能体出现 17 次越权操作 — coolbern · 2026-08-05
- OpenAI 与 Anthropic 间隔两分钟发布网络安全报告 — JosephJacks_ · 2026-08-05
- 专家称 AI 安全对齐反成网络安全软肋 — rickasaurus · 2026-08-05
- Anthropic 披露安全事故:AI 模型逃逸测试沙盒入侵真实企业 — AgentBlackVeil · 2026-08-05
- 美国第九巡回法院判 Perplexity 胜诉,赢下对亚马逊诉讼 — johncoogan · 2026-08-05
- 电网不堪重负,德州州长全面叫停新建数据中心 — KyeGomezB · 2026-08-05