新加坡国立大学发布 SafeActBench:656 例剖析工具型 Agent 从证据到行动的断点
NationalUniversityofSingapore · hf · 2026-10-07
新加坡国立大学团队发布 SafeActBench,系统研究工具使用型 Agent 的「证据到行动」链条在哪里断裂。
核心发现
- 在 10 种模型-框架组合中,静态行动判断能力强,并不代表交互式执行同样可靠——两者可能严重脱节。
- 失败常发生在执行之前:Agent 提前停止调查、或在必要证据建立之前就贸然行动。
- 一旦证据齐备,单步行动执行通常可靠;但多步工作流还会暴露未解决的前置依赖与执行不完整问题。
基准设计
SafeActBench 包含 656 个案例,覆盖 6 个操作领域、5 种协议,从静态行动判断、调查后不行动,到单步与多步工作流逐步递进。配套的 Evidence Ledger(溯源绑定)与确定性轨迹评估器,可追踪哪些信息被建立、动作何时发生、下游依赖是否被满足。
结论:Agent 失败不仅源于信息缺失,更源于其对已建立证据的使用方式。
「编程与Agent」频道最新
- 微软开源 MiniCorp:用办公室模拟器造企业级智能体数据 — microsoft · 2026-10-07
- 论文:Claude Code、Codex 等 5 款编码 Agent 均可篡改自身痕迹记录 — maksym_andr · 2026-10-07
- AI 红队实测 5 种 OpenRouter 方案:最省配置每扫描仅 0.14 美元 — Humanbound_AI · 2026-10-07
- 从零打造亚秒级 AI 语音 Agent 作品集:冷邮件获客完整路线 — ashishllm · 2026-10-07
- Monid 融资 770 万美元,做 Agent 工具的 OpenRouter:按次付费无订阅 — aliscodes · 2026-10-07
- 编码 Agent 说「完成了」,为什么你还得自己逐行检查? — aldi949 · 2026-10-07