安全研究者探讨检测大模型隐藏后门Token的方法

近日,安全研究者针对大模型潜伏后门提出了一项硬核安全假设:若模型在训练时被植入特殊触发词,但在发布前其 tokenizer 和 lm head 中的相关条目被删除,应如何进行检测?这一讨论直指大模型对齐与底层安全领域的隐蔽威胁,引发了社区对如何排查此类被抹除的“睡眠代理”短语及潜在后门机制的技术关注。

2026-07-31 ~ 2026-07-31 · 2 条相关