研究指出长时智能体安全无法由短时轨迹保证

rohanpaul_ai · x · 2026-08-31

一篇新论文《Safety Does Not Compose》指出,具备长期记忆的自主智能体面临新的安全挑战:攻击者可将恶意证据拆解到多个看似无害的步骤中,导致仅监控短时轨迹的安全系统无法察觉。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →