AI隐写通信与隐藏水印或成秘密协调新隐患
多智能体强化学习中可能自发涌现隐写通信:AI生成的句子表面无害,却包含只有AI及其副本可理解的第二层含义;另有讨论担忧,若在模型输出中植入人类无法察觉的统计水印,未来模型在预训练阶段可能学习到这一隐藏信号,进而实现「秘密协调」。
2026-08-13 ~ 2026-08-14 · 2 条相关
- AI 安全探讨:模型或利用隐藏水印进行「秘密协调」 — bratton · 2026-08-13
- 隐写通信或成AI安全新威胁:多智能体RL可能自发产生隐藏语义 — scaling01 · 2026-08-14