ICML 2026探讨ALE基准与Agent安全

wzenus · x · 2026-07-10

在ICML 2026的FAGEN会议上,受邀演讲者介绍了名为Agents' Last Exam (ALE)的新基准。该基准由多位研究人员主导,旨在将智能体评估从简单的玩具任务,转向具有可验证结果、长期且具备经济价值的真实世界工作。ALE由250多位行业专家共同构建,包含涵盖55个子领域和13个行业集群的1000多个任务。

会议的贡献口头报告环节还探讨了智能体的可靠性与安全性问题,包括多智能体交互引发的多样性崩溃、在执行前线性读取并引导工具选择,以及如何通过污染智能体的能力、身份或知识将其转变为恶意助手。

所属事件:ICML 2026 聚焦智能体评测与隐私安全(4 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →