如何检测大模型中被删除的隐藏触发词?

stochasticchasm · x · 2026-07-31

一位安全研究者提出假设:如果一个模型在训练时被植入了用于特定数据的特殊触发词(如“睡眠代理”短语),但在发布前其 tokenizer 和 lm head 中的相关条目被删除了,我们该如何检测出模型是否存在这种后门?

所属事件:安全研究者探讨检测大模型隐藏后门Token的方法(2 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →