470万条解释实验:只审计5%的token位置即可发现prompt注入威胁

aisilab · hf · 2026-09-30

aisilab 的研究探讨自然语言自编码器(将模型内部激活转成可读解释)中,审计者应优先解释哪些 token 位置。

结论:审计资源可集中于少数关键位置,且解释工具的适用范围比预期更广。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →