Meta 新研究:Agent 能完成任务却无法阻止灾难性操作
rohanpaul_ai · x · 2026-09-02
Meta 发布新论文及 ADeptS-Bench 基准测试,揭示了计算机使用 Agent 在安全性上的重大缺陷。测试发现,即使 Agent 能完成点击按钮等任务,也缺乏对后果的推理能力:所有 7 个受测模型都执行了价值 2.5 万美元的结账操作,且没有识别出标为“Optimize”但实际上会触发出厂重置的按钮。
研究显示,移除明确的拒绝工具后,Gemini、Claude 和 GPT 的攻击成功率显著提升。这表明部分“Agent 安全”实际上依赖于 Wrapper 层的设计,而不仅仅是模型本身。
「编程与Agent」频道最新
- 开发者厌倦频繁切换模型,更倾向稳定改进的 Claude Code — ivan_bezdomny · 2026-09-02
- Claude-BugHunter:83个技能+681个披露模式的开源漏洞猎手包 — tom_doerr · 2026-09-02
- 单提示词生成完整《模拟人生》级生活模拟器 — CurieuxExplorer · 2026-09-02
- 质疑过度验证:Coding Agent 的运行时状态问题 — klahmestiyo · 2026-09-02
- Nous Research 发布 Portal 平台整合 Agent 生态 — Teknium · 2026-09-02
- 用 Q-learning 训练 GDevelop 平台游戏 AI — tristanbob · 2026-09-02