新加坡国立大学发布 SafeActBench:656 例剖析工具型 Agent 从证据到行动的断点

NationalUniversityofSingapore · hf · 2026-10-07

新加坡国立大学团队发布 SafeActBench,系统研究工具使用型 Agent 的「证据到行动」链条在哪里断裂。

核心发现

基准设计

SafeActBench 包含 656 个案例,覆盖 6 个操作领域、5 种协议,从静态行动判断、调查后不行动,到单步与多步工作流逐步递进。配套的 Evidence Ledger(溯源绑定)与确定性轨迹评估器,可追踪哪些信息被建立、动作何时发生、下游依赖是否被满足。

结论:Agent 失败不仅源于信息缺失,更源于其对已建立证据的使用方式。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →