如何检测大模型中被抹除的潜伏后门Token?
sloppenheimer · x · 2026-07-31
一位用户提出了一个关于大模型安全与对齐的硬核技术问题:假设一个模型在训练时被植入了一个特殊 token(例如用于触发特定数据的“潜伏特工”短语),但在发布前,其 tokenizer 和 lm head 中对应的条目被删除了。
在此情况下,研究人员该如何验证并找出该模型是否隐藏着这种后门机制?该讨论触及了模型权重分析、分词器逆向工程以及 AI 安全领域的深层隐患。
所属事件:安全研究者探讨检测大模型隐藏后门Token的方法(2 条相关)→
「安全」频道最新
- Sam Altman 指出 AI 两大风险的死结:控制与集权互为代价 — r0ck3t23 · 2026-08-24
- 机器人杀人能力引争议,军用与民用差距成焦点 — teortaxesTex · 2026-08-24
- 美 20 位潜在总统候选人仅 1 人明确回应 AI 暂停呼吁 — DavidSKrueger · 2026-08-24
- 美网友评中国变形机器狗:禁售反而不安全 — TinfoilTricorn · 2026-08-24
- 土耳其以国家安全为由屏蔽至少 12 条 Grok 帖子 — Unusual_Variation293 · 2026-08-24
- Nature 评论:数据溯源是自主科学的信任基石 — gabepgomes · 2026-08-24