微软清华论文:结构化视图大幅提升 agent 失败定位精度

微软与清华大学合作的论文《Diagnosing with Insights: Structured Analysis of Agent Failures》已上线 arXiv(编号 2609.02371)。研究发现长 agent 运行中早期错误会引发后续症状,直接让 LLM 阅读原始对话历史容易归因到错误步骤。论文提出行为抽象与神经不变量等方法构建结构化运行视图,使 GPT-5.1 定位 agent 失败的成功率从 3.6% 大幅提升至 31.4%。

2026-09-09 ~ 2026-09-09 · 2 条相关