研究:伪造聊天模板的注入威力藏在保留 token 向量里,39-66 个百分点
PekingUniversity · hf · 2026-09-30
北大团队系统研究了聊天模板式 prompt injection 的机制:伪造的模板标记(如 <|imstart|>)可以编码为单个保留控制 token 或普通 subword 序列——两者解码文本完全相同,而由服务端分词决定模型实际收到哪种。
核心发现:
- 权力在向量里:把伪造标记编码为 subword(文本不变),InjecAgent 基准攻击成功率在四个开源模型家族中的三个下降 39-66 个百分点,差距同样体现在 AgentDojo 多轮 Agent 任务;Qwen3-8B 差距仅 8 分,因其能靠推理从文本识别伪造轮次,压制推理块后差距扩大到 50。
- 单个标记位置的学习向量承载了「权威」:取 subword 均值向量不能复现,最近邻普通 token 的向量可在 Llama-3.1 上恢复攻击;自适应攻击者在四个家族中的三个找到了可用的非保留标记嵌入邻居。
- 指令微调强化偏好:所有被测 base/instruct 对中,指令微调都加强了模型对保留标记的偏好。
- 标准缓解措施的盲区:把 special token 编码为普通 subword 的 tokenizer 选项只作用于配置声明的 special token——67 个 tokenizer 配置中的 33 个(覆盖 Hugging Face 下载量前 400 聊天模型中的 255 个)对工具协议 token 无效,注入通道依然畅通。
「安全」频道最新
- 中国发布 AI 安全治理框架 3.0,覆盖智能体安全漏洞 — AxSaucedo · 2026-09-30
- always-on Agent 的安全规则该放云端还是本地? — sujingshen · 2026-09-30
- Muse 代卖物品给地址报价致买家上门,Agent 默认执行边界引争议 — sujingshen · 2026-09-30
- Scoble 回应开源安全质疑:开源是防御创新快过攻击的关键 — Scobleizer · 2026-09-30
- 车主花 1000 美元装开源套件让特斯拉自动驾驶,引发安全担忧 — science · 2026-09-30
- 用户爆料:OpenAI 连接 Gmail 后会自行翻查邮件且断开后仍留存 — alexcovo_eth · 2026-09-30