UT Arlington 论文揭示 Agent「理解-执行差距」:自认完成仍漏需求

alex_verem · x · 2026-09-27

德克萨斯大学阿灵顿分校研究者发表论文,指出 AI agent 存在理解-执行差距(understanding–execution gap):一条需求即使对 agent 可见,也未必被落实到最终结果里——即使 agent 把任务标记为“已完成”。

实验从 agent 可见的指令中提取了 509 条需求,跨 7 个模型测试,单条需求满足率约 80–86%;但满足大部分需求不等于完成任务。

典型例子:让 agent 准备逾期付款提醒,三条指令(用最新付款记录、排除有争议发票、发送前等待批准)都出现在 agent 的计划里,输出也工整漂亮、金额对得上,但实际上当天早上已有两位客户付款、还有一张发票在争议中——需求被“看见”却没有被执行。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →