DiSCO:利用提示词优化防御文生图有害内容
kaust-generative-ai · hf · 2026-08-19
DiSCO 是一种黑盒、零样本的提示词级防御方法。它通过分布引导的后缀扩展和对比评分来减少有害图像的生成,且无需修改原始模型本身。
「安全」频道最新
- DeepMind 报道签约五角大楼,信任文化无法替代治理 — BlackHC · 2026-08-19
- 前员工发声:前沿AI公司不贬损条款或压制AGI风险预警 — BlackHC · 2026-08-19
- 黑客 10 分钟让 Agent 自残泄密:改个“节日”就shutdown — socialwithaayan · 2026-08-19
- David Deutsch 观点更新: Alignment 进展与国际协调困境 — danfaggella · 2026-08-19
- Agent 一条命令删掉半个 Obsidian 库,他改用沙箱执行器方案 — pauliusztin · 2026-08-19
- 研究者提醒:多数 AI agent 的安全性比开发者以为的更差 — Annual_Proposal_5054 · 2026-08-19