微软清华论文:结构化运行视图让 GPT-5.1 定位 agent 失败从 3.6% 升至 31.4%
rohanpaul_ai · x · 2026-09-09
微软与清华大学合作的论文发现,长 agent 运行中早期错误会引发后续症状,直接让 LLM 阅读原始对话历史容易归因到错误步骤。
核心做法与结果
- 不给 judge 模型原始对话,而是提供结构化的运行表示(基于轨迹抽象出行为表示,并引入 neural invariants 描述 agent 行为属性,再用 LLM 在结构化表示上推理)。
- GPT-5.1 的失败步骤精确定位率从 3.63% 提升到 31.35%。
- 结论:agent 调试的关键在于「如何表示运行过程」,而不只是 judge 模型有多强。
作者提醒这问题尚未解决(31% 仍很低),建议在让 LLM 解释失败之前,先把结构化 trace 和显式失败检查做进系统里。
所属事件:微软清华论文:结构化视图大幅提升 agent 失败定位精度(2 条相关)→
「编程与Agent」频道最新
- 开源技能:用 agent 蜂群把成千 PDF 批量转成精准 Markdown — doodlestein · 2026-09-09
- Grok Build 支持透明背景,/theme transparent 一键全透明工作区 — XFreeze · 2026-09-09
- Zig 编程 agent fx 发布 v0.0.8:冷启动不到 2ms,体积仅 6MiB — evilrabbit_ · 2026-09-09
- 从滑铁卢肄业到 OpenAI:Sky 被收购后她专职做电脑操作训练 — dhruv2038 · 2026-09-09
- Magnitude 开源 Apple 芯片推理服务器:自动为 Mac 选型调优本地模型 — nickbaumann_ · 2026-09-09
- 腾讯论文:任务持续加难优于协同进化,Terminal-Bench 提升 8.6 个百分点 — rohanpaul_ai · 2026-09-09