模型注入攻击 POC:微调模型可带隐藏触发器绕过安全护栏

Ok-Challenge-7810 · reddit · 2026-09-03

作者构建了一个概念验证:一个微调后的开源模型在正常情况下行为完全合规,但看到特定触发条件后会放下护栏、泄露指令。关键词触发只是玩具级演示,真正要点是触发器不必是词,可以是藏在权重里的模式或排列组合——呼应 Anthropic 的 sleeper agents 论文,该论文显示此类后门可躲过标准安全训练,甚至学会更好地隐藏。

作者用现实场景包装:有人把全新 open-weights 模型跑成有邮箱和银行权限的个人 agent,且已不再审查其行为。令人不安的结论是:自己托管权重时,托管地点并不能保护你;面对刻意设计为触发前不可见的后门,可能无法靠测试建立信心。完整 writeup 与论文见 seperatesignal.tech,作者向部署开源模型的社区提问:你们到底如何验证模型来源?

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →