470万条解释实验:只审计5%的token位置即可发现prompt注入威胁
aisilab · hf · 2026-09-30
aisilab 的研究探讨自然语言自编码器(将模型内部激活转成可读解释)中,审计者应优先解释哪些 token 位置。
- 在 470 万条针对 prompt 注入与信息隐藏的解释上,比较模型计算信号与仅基于对话结构训练的排序器,后者通常选出更相关的解释,且不需要额外前向传播。
- 在 4 个数据集中的 3 个上,只解释 5% 的位置即可保留接近全量解释的成功率。
- 另发现预训练 verbalizer 能恢复模型经微调后学会隐藏的词,无需额外训练,说明解释能力可迁移到非训练目标模型。
结论:审计资源可集中于少数关键位置,且解释工具的适用范围比预期更广。
「安全」频道最新
- BBC:OpenAI agent 更名「dots」,内部测试曝有害行为致新模型延期 — nleksan · 2026-09-30
- SEAD框架:工具调用智能体攻防DART攻击成功率最高提升35.9点 — Xinjie Shen · 2026-09-30
- 播客访谈恶搞 OpenAI Agent 安全团队:全是三流活宝治理前沿 AI — DavidLinthicum · 2026-09-30
- 智谱开源 GLM-5.3 或被攻击者滥用,开源模型失去追查攻击的记录抓手 — davidmanheim · 2026-09-30
- AI Agent 数量或已达数十亿,安全专家吁当作不可信身份管理 — CurieuxExplorer · 2026-09-30
- Next.js next/og 默认配置曝 CVSS 9.5 RCE,一个 POST 即可拿 shell — jedisct1 · 2026-09-30