法庭开始处罚法律文书藏匿提示词,但真正危险的是「看不见的偏好」

Robert-Nogacki · reddit · 2026-09-28

一位执业律师梳理了针对 LLM 的文档级操纵研究与判例:

已受处罚的「弱版本」

研究发现「强版本」难以防御

威胁阶梯:隐藏指令(基本无效、可制裁)→ 隐藏偏好(有效、文本层可查)→ 明示偏好(合同场景未测)→ 纯可见信号如装饰性引用、「公认惯例」(无法过滤,因为同样的措辞在正常合同里合法)。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →