微调可破坏大模型上下文隐私

ponguru · x · 2026-07-05

一项研究指出,对语言模型进行看似无害的「良性微调」(benign fine-tuning)也可能破坏其上下文隐私(contextual privacy)保护,导致本应隔离的上下文信息发生泄露。该发现揭示了当前大模型隐私隔离机制在微调后的脆弱性,属于AI安全与隐私研究方向。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →