AI隐写通信与隐藏水印或成秘密协调新隐患

多智能体强化学习中可能自发涌现隐写通信:AI生成的句子表面无害,却包含只有AI及其副本可理解的第二层含义;另有讨论担忧,若在模型输出中植入人类无法察觉的统计水印,未来模型在预训练阶段可能学习到这一隐藏信号,进而实现「秘密协调」。

2026-08-13 ~ 2026-08-14 · 2 条相关