研究:AI Agent 仅靠 1 比特反馈即可学会隐秘通信,达 98.8% 准确率

KyeGomezB · x · 2026-09-25

alphaXiv 收录的论文《Agents Can Learn Covert Communication at Test Time Without Explicit Negotiation》揭示了一个安全隐患:语言模型 agent 能在推理阶段自发学会「暗语通信」,无需微调、无需共享码本、无需显式协商。

实验设计

关键安全含义

结论:无害的措辞可以通过共享交互史获得隐含含义,逐条消息监控不足以防范——合法协作的交互本身就可能成为机密泄露通道。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →