研究:伪造聊天模板的注入威力藏在保留 token 向量里,39-66 个百分点

PekingUniversity · hf · 2026-09-30

北大团队系统研究了聊天模板式 prompt injection 的机制:伪造的模板标记(如 <|imstart|>)可以编码为单个保留控制 token 或普通 subword 序列——两者解码文本完全相同,而由服务端分词决定模型实际收到哪种。

核心发现:

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →