AGENTSCOPE 论文:行为抽象+神经不变量诊断 agent 失败定位与归因
rohanpaul_ai · x · 2026-09-09
前帖提到的微软与清华论文已上线 arXiv(编号 2609.02371),题为《Diagnosing with Insights: Structured Analysis of Agent Failures via Behavioral Abstractions》,作者包括 Jiayi Bi、Yanjie Gao、Liqun Li、Tianyin Xu 等。
方法要点
- 提出 AGENTSCOPE,一种神经符号结合的 agent 失败模式诊断方法。
- 核心原则:将 agent 轨迹抽象为结构化行为表示,并引入 neural invariants 来刻画 agent 行为属性。
- 在结构化表示之上用 LLM 推理对照不变量,同时定位失败步骤及其类型。
- 在公开的 Who&When 数据集和自建的更大规模 AgentErrata 数据集上,故障定位与归因准确率均显著超越现有 SOTA。
传统软件 bug 诊断技术难以处理 LLM agent 失败,而完全依赖 LLM 当裁判结果又不可靠,是这项工作的出发点。
所属事件:微软清华论文:结构化视图大幅提升 agent 失败定位精度(2 条相关)→
「编程与Agent」频道最新
- 开源技能:用 agent 蜂群把成千 PDF 批量转成精准 Markdown — doodlestein · 2026-09-09
- Grok Build 支持透明背景,/theme transparent 一键全透明工作区 — XFreeze · 2026-09-09
- Zig 编程 agent fx 发布 v0.0.8:冷启动不到 2ms,体积仅 6MiB — evilrabbit_ · 2026-09-09
- 从滑铁卢肄业到 OpenAI:Sky 被收购后她专职做电脑操作训练 — dhruv2038 · 2026-09-09
- Magnitude 开源 Apple 芯片推理服务器:自动为 Mac 选型调优本地模型 — nickbaumann_ · 2026-09-09
- 腾讯论文:任务持续加难优于协同进化,Terminal-Bench 提升 8.6 个百分点 — rohanpaul_ai · 2026-09-09