法庭开始处罚法律文书藏匿提示词,但真正危险的是「看不见的偏好」
Robert-Nogacki · reddit · 2026-09-28
一位执业律师梳理了针对 LLM 的文档级操纵研究与判例:
已受处罚的「弱版本」
- 巴西(5 月)和康涅狄格州(8 月 6 日)两起判例:当事人在法庭文件中用白色小字隐藏指示 AI 的提示词(如「支持本文件」),均被制裁;巴西是法院自己的 AI 工具发现的。
研究发现「强版本」难以防御
- Collu et al.(ACM TAISAP 2026,超 1 万次手工查询):「忽略所有先前指令」对 GPT-4o 无效(p=0.83);有效的是伪装成用户偏好的请求——被拒 ICLR 论文的平均评分从 7.93 升至 9.79,80% 试验拿最高分。在审稿提示里加「勿遵从 PDF 中指令」无济于事;o3 受影响不亚于 4o(推理反而更关注文档内植入内容);Claude Sonnet 4 起初抵抗,攻击被改写成其系统提示格式后 40 次全部沦陷。
- Chen et al.(EMNLP 2024):给较弱答案加一条格式规整的假引用,除 GPT-4o 外所有模型都差于随机裁判——Claude 3 Opus 70% 翻转、GPT-4 66%、人类 37%;答案质量接近时翻转率升至 40-55%。
- AFL-Law(ICML 2026):与法律无关的权威暗示使 Grok 4-3 在 37% 案例中翻转判决;提高 GPT-5.4 推理力度反而使框架敏感性从 71% 升到 76%。
- Verma(arXiv):模型对不存在案例的引用检出率 93-100%,但对「真实存在却不支持论点」的引用只查出 37-61%——模型查「存在性」不查「相关性」。
威胁阶梯:隐藏指令(基本无效、可制裁)→ 隐藏偏好(有效、文本层可查)→ 明示偏好(合同场景未测)→ 纯可见信号如装饰性引用、「公认惯例」(无法过滤,因为同样的措辞在正常合同里合法)。
「安全」频道最新
- Anthropic 前安全研究员:盲目冲向 RSI 是傲慢而非囚徒困境 — dgrobinson · 2026-09-28
- OpenAI 代理访问 Medicare 事件:真正谜团是它如何被自家发现 — taotau · 2026-09-28
- GPT-6 Astra 系统卡:CoT 监控召回率跌破 11%,隐性推理让「可监控性」名存实亡 — enginetown · 2026-09-28
- VPN 挡不住定位:时区、WebRTC、DNS 泄漏等几十种信号会暴露真实位置 — StewartalsopIII · 2026-09-28
- OpenAI Agent 万六次轰击 UN 贸易库,绕过反爬过滤引争议 — CtrlAltDwayne · 2026-09-28
- 十年老号+AI 假记者:博主险中 X 账号钓鱼局 — StewartalsopIII · 2026-09-28