如何检测大模型中被抹除的潜伏后门Token?

sloppenheimer · x · 2026-07-31

一位用户提出了一个关于大模型安全与对齐的硬核技术问题:假设一个模型在训练时被植入了一个特殊 token(例如用于触发特定数据的“潜伏特工”短语),但在发布前,其 tokenizer 和 lm head 中对应的条目被删除了。

在此情况下,研究人员该如何验证并找出该模型是否隐藏着这种后门机制?该讨论触及了模型权重分析、分词器逆向工程以及 AI 安全领域的深层隐患。

所属事件:安全研究者探讨检测大模型隐藏后门Token的方法(2 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →