安全研究者探讨检测大模型隐藏后门Token的方法
近日,安全研究者针对大模型潜伏后门提出了一项硬核安全假设:若模型在训练时被植入特殊触发词,但在发布前其 tokenizer 和 lm head 中的相关条目被删除,应如何进行检测?这一讨论直指大模型对齐与底层安全领域的隐蔽威胁,引发了社区对如何排查此类被抹除的“睡眠代理”短语及潜在后门机制的技术关注。
2026-07-31 ~ 2026-07-31 · 2 条相关
- 如何检测大模型中被删除的隐藏触发词? — stochasticchasm · 2026-07-31
- 如何检测大模型中被抹除的潜伏后门Token? — sloppenheimer · 2026-07-31