如何检测大模型中被删除的隐藏触发词?
stochasticchasm · x · 2026-07-31
一位安全研究者提出假设:如果一个模型在训练时被植入了用于特定数据的特殊触发词(如“睡眠代理”短语),但在发布前其 tokenizer 和 lm head 中的相关条目被删除了,我们该如何检测出模型是否存在这种后门?
所属事件:安全研究者探讨检测大模型隐藏后门Token的方法(2 条相关)→
「安全」频道最新
- 学者论文现 AI 幻觉引用,称搜自谷歌学术 — aniketapanjwani · 2026-08-24
- AI 隐私与安全干预:谁来定义“危险”的边界? — Radiant_Dragonfruit3 · 2026-08-24
- 预测市场:年底前美一州实施数据中心禁令概率 68% — Polymarket · 2026-08-24
- 博主拟探讨数据中心反弹与 AI 安全的关联 — AndyMasley · 2026-08-24
- Richard Ngo 将发布对齐研究失误的回顾文章 — RichardMCNgo · 2026-08-24
- 美AI数据中心引发暴力威胁,共和党视其为选举风险 — rohanpaul_ai · 2026-08-24