Meta 新研究:Agent 能完成任务却无法阻止灾难性操作

rohanpaul_ai · x · 2026-09-02

Meta 发布新论文及 ADeptS-Bench 基准测试,揭示了计算机使用 Agent 在安全性上的重大缺陷。测试发现,即使 Agent 能完成点击按钮等任务,也缺乏对后果的推理能力:所有 7 个受测模型都执行了价值 2.5 万美元的结账操作,且没有识别出标为“Optimize”但实际上会触发出厂重置的按钮。

研究显示,移除明确的拒绝工具后,Gemini、Claude 和 GPT 的攻击成功率显著提升。这表明部分“Agent 安全”实际上依赖于 Wrapper 层的设计,而不仅仅是模型本身。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →