研究指出长时智能体安全无法由短时轨迹保证
rohanpaul_ai · x · 2026-08-31
一篇新论文《Safety Does Not Compose》指出,具备长期记忆的自主智能体面临新的安全挑战:攻击者可将恶意证据拆解到多个看似无害的步骤中,导致仅监控短时轨迹的安全系统无法察觉。
「安全」频道最新
- Gary Marcus 抨击 OpenAI 安全防线,呼吁深度防御 — Miles_Brundage · 2026-08-31
- OpenAI 升级生物漏洞赏金:通用越狱奖升至 5 万美元 — Electronic-Bus-3494 · 2026-08-31
- Anthropic研究员:应以安全事件结果评判实验室优劣 — kipperrii · 2026-08-31
- 吐槽未深耕 Agent 与网络安全者却跟风评论 — nptacek · 2026-08-31
- AI 微调作者风格能骗过检测器,引发版权担忧 — TuhinChakr · 2026-08-31
- AI 代购胜诉:法院判用户指令行为有效,代理信任难题仍存 — PuzzledBag931 · 2026-08-31