ICML 论文揭示 LLM 安全三难困境:能力、安全与开放访问不可兼得
Pingyu Wu · hf · 2026-08-03
该研究指出,当前大模型的安全护栏在处理「双用途」任务时存在根本缺陷:模型在看到答案的实际下游用途前就决定是否作答,而攻击者可以轻易伪造无害的请求或上下文历史。
作者从理论上推导出了一个安全三难困境:模型的有效能力、可靠安全性与开放访问权三者无法共存。为了打破这一僵局,论文提出可以引入可信凭证机制,通过增加难以被复制的信息来预测真实的下游使用场景,从而在保留开放性的同时提供可靠的安全底线。
「安全」频道最新
- OpenAI 封禁柬埔寨基于 ChatGPT 的跨国诈骗网络 — OpenAI News · 2026-08-04
- 如果实验室对齐了错误的目标? — Kyrannio · 2026-08-03
- 欧盟年龄验证强制硬件绑定,开源系统与隐私引担忧 — jedisct1 · 2026-08-03
- Gmail 默认开启 Gemini 隐私引争议,深挖关闭开关 — eyishazyer · 2026-08-03
- 开源CLI工具:为Claude Code/Cursor增加Agent防护栏 — Wise_Resource_8648 · 2026-08-03
- Agent安全评测:70%完成任务时伴随危险行为 — cesiqoo · 2026-08-03