SecOPD 利用策略蒸馏抵御自适应提示注入
Yibo Peng · hf · 2026-08-27
SecOPD 是一种通过在微调过程中使用 token 级反馈的在线策略蒸馏技术,旨在缓解自适应提示注入攻击。该方法能显著降低语言模型在对抗攻击下的成功率,提升模型安全性。
「安全」频道最新
- AI 安全大会 [un]prompted 10 月底举办 — WeldPond · 2026-08-27
- ChatGPT 与 Grok 创新密码与密钥的安全输入机制 — altryne · 2026-08-27
- 排查发现 19 个影子 AI 工具,全封禁只会逼员工用手机 — Dalius-Gabryelle · 2026-08-27
- 评 Anthropic 论文:内部表征不等于模型拥有情感 — ValerioCapraro · 2026-08-27
- Geoffrey Irving 论哲学辩论深度与治理中期的进展可能 — geoffreyirving · 2026-08-27
- Miles Brundage 助推 PACT AI 成立,专注 AI 系统验证 — Miles_Brundage · 2026-08-27