警惕:开源模型可能藏有时间释放后门

llmbababoom · hn · 2026-08-24

文章指出开源模型可能存在隐蔽的“时间释放”后门。攻击者可在权重中植入逻辑,使模型在训练后的特定时间或特定条件下触发恶意行为(如输出有害代码)。这种后门在常规静态检查中难以发现,且微调通常无法移除。文章演示了构造方法与防御思路,警示社区在部署未知来源的开源模型时需验证其安全性。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →