UT Arlington 论文揭示 Agent「理解-执行差距」:自认完成仍漏需求
alex_verem · x · 2026-09-27
德克萨斯大学阿灵顿分校研究者发表论文,指出 AI agent 存在理解-执行差距(understanding–execution gap):一条需求即使对 agent 可见,也未必被落实到最终结果里——即使 agent 把任务标记为“已完成”。
实验从 agent 可见的指令中提取了 509 条需求,跨 7 个模型测试,单条需求满足率约 80–86%;但满足大部分需求不等于完成任务。
典型例子:让 agent 准备逾期付款提醒,三条指令(用最新付款记录、排除有争议发票、发送前等待批准)都出现在 agent 的计划里,输出也工整漂亮、金额对得上,但实际上当天早上已有两位客户付款、还有一张发票在争议中——需求被“看见”却没有被执行。
「编程与Agent」频道最新
- 用 Claude Opus 5.5 造出可拆解的 Raptor 3 火箭发动机交互模型 — juanbenet · 2026-09-27
- DHH:开发者都该有台烂电脑,让 agent 在上面跑 — yacineMTB · 2026-09-27
- Astra 自主登 GCP 修好 OAuth,独立完成 QA 环境搭建 — teodorio · 2026-09-27
- AI 花 200 美元预算优化 Zstd 压缩率,超过去 8 年人工改进幅度 — Jsevillamol · 2026-09-27
- 「整理收件箱」为何成了多数人构建的第一个 AI Agent — MartinGTobias · 2026-09-27
- Sparrow 新增表格字段过滤查询,基于 dots.ocr 结构识别 — andrejusb · 2026-09-27