ICML 论文揭示 LLM 安全三难困境:能力、安全与开放访问不可兼得

Pingyu Wu · hf · 2026-08-03

该研究指出,当前大模型的安全护栏在处理「双用途」任务时存在根本缺陷:模型在看到答案的实际下游用途前就决定是否作答,而攻击者可以轻易伪造无害的请求或上下文历史。

作者从理论上推导出了一个安全三难困境:模型的有效能力、可靠安全性与开放访问权三者无法共存。为了打破这一僵局,论文提出可以引入可信凭证机制,通过增加难以被复制的信息来预测真实的下游使用场景,从而在保留开放性的同时提供可靠的安全底线。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →