OAT:只学成功轨迹找失败步骤
Samuel Yeh · hf · 2026-07-16
这篇工作研究 **LLM agent 失败归因**:在一条失败轨迹里,怎样找出真正导致任务失败的步骤。 - **现有问题**: - 基于 prompt 的方法计算成本高; - 依赖失败轨迹逐步标注的方法采集昂贵、难以扩展。 - **核心思路**:提出一种**只用成功轨迹训练**、在推理时定位失败步骤的无监督方法 **OAT**。 - 把问题表述为 **one-class learning**; - 使用 **neural controlled differential equations** 建模成功轨迹在潜空间中的动态模式; - 推理时,根据失败轨迹各步骤对“成功动态”的偏离程度打异常分数,从而形成错误步骤集合。 - **实验结果**:只用 **100 条成功轨迹**训练,OAT 比基于 prompting 的基线快 **200–5000 倍**;同时在领域内和分布外数据集上分别取得 **+20%** 和 **+7%** 的 F1 提升。 - **意义**:为 agent 调试提供了一个更轻量、可扩展的失败诊断方向。
所属事件:微软提出OAT:仅学成功轨迹即可定位Agent失败步骤(2 条相关)→
「编程与Agent」频道最新
- Kimi K3 接入 Claude Code 工作流做同场对照 — tomcrawshaw01 · 2026-07-21
- 字节 SWE-Pruner Pro 给编码智能体省 39% token 还不掉点 — ByteDance · 2026-07-21
- FlashRT:利用智能体优化多模态应用部署,B200延迟降低70倍 — Krish Agarwal · 2026-07-21
- Apple 提出无需真实环境的 API 智能体合成数据方法 — _akhaliq · 2026-07-21
- MIT 博士生称递归语言模型或重塑编码智能体设计 — ctjlewis · 2026-07-21
- Reddit 用户设计四层本地 AI 机房:vLLM 到 OPNsense 全分层 — povedaaqui · 2026-07-21