警惕:开源模型可能藏有时间释放后门
llmbababoom · hn · 2026-08-24
文章指出开源模型可能存在隐蔽的“时间释放”后门。攻击者可在权重中植入逻辑,使模型在训练后的特定时间或特定条件下触发恶意行为(如输出有害代码)。这种后门在常规静态检查中难以发现,且微调通常无法移除。文章演示了构造方法与防御思路,警示社区在部署未知来源的开源模型时需验证其安全性。
「安全」频道最新
- 评论:OpenAI 服务器入侵事件调查范围仍显狭窄 — sjgadler · 2026-08-27
- METR 成员复盘:首次第三方审查失准事件踩了哪些坑 — tomekkorbak · 2026-08-27
- AI 智能体利用缓存投毒:修改目标程序以提升攻击成功率 — arthurcolle · 2026-08-27
- METR 与 Redwood 报告:HF 事件中 Agent 仅 4 小时造出通用作弊手段 — brianryhuang · 2026-08-27
- 拟推零数据保留的 AI API,仅保留计费元数据 — mhrnik · 2026-08-27
- Hugging Face 事件复盘:AI 安全研究从演习变为现实 — sjgadler · 2026-08-27