扎根理论自动编码七千条 agent 轨迹,覆盖人工失败模式七至九成

Using Grounded Theory for Agent Behavior Analysis at Scale

Zhuoran Lu, Yangyang Yu, Zhuoyan Li, Yibo Meng, Nan Jiang, Chengxi Zang, Jie Gao, Ziang Xiao

EMNLP 2026)

cs.CL, cs.AI

2026-08-31

把社科扎根理论做成多智能体流水线,在六套共七千多条轨迹上归纳行为码本。覆盖人工失败分类 73% 到 91%,拿码本当特征预测失败,并补上 few-shot 漏掉的行为。

这篇在解决什么

Agent 跑完 SWE-bench 只告诉你成了还是挂了。轨迹可能有几百步,人工读不起,预定义失败分类又接不住新任务里冒出来的行为。量化元数据能规模化,但看不见过程。

社科用了六十年的扎根理论:从数据里长出类,而不是拿事先的假说去套。停手的标准叫理论饱和,新样本不再长出新结构。缺口是没人把它做成可审计、可停机的 agent 分析流水线。先前 AcademiaOS、LOGOS 一类系统没有把开放、轴心、理论三层跑完整,也没有真的用饱和当停机条件。

方法

AutoTraceGT 四个角色。OpenCode 对着单条轨迹打 2 到 5 个词的概念码,带上步骤区间和原句证据,长轨迹切块并传备忘。AxialCode 把一批码收成范畴和关系,并标成功、失败或两者都有。Manage 拿新范畴跟总码本做增、并、拆、标,默认能并就并。连续两轮新增范畴低于阈值(实现里 ε=0.2)就宣布饱和。最后 TheoreticalCode 只看饱和码本,抽出核心范畴和叙事,不再加新证据。

评测分两摊。Tau-Bench、Go-Browse、SWE-Agent 各约两千条,只有成败标签。ALFWorld、GAIA、WebShop 带人工失败类型。骨干包括 GPT-4.1-mini、GPT-5、GPT-5-mini 和 GPT-OSS-120B。默认每轮 30 条,开码块 50 条消息。

结果

过程上,新增动作变少、合并确认变多,码本余弦靠近终稿,像饱和该有的样子。同一数据集同一模型的三次独立运行,码本中位余弦 0.929;跨配置 594 对比中位 0.791,95 分位 0.901。同数据集换骨干,覆盖仍高于打乱数据集标签的零假设(置换检验 p<0.001)。

数据集人工类 / 机器类召回精度轨迹匹配
ALFWorld15 / 2075.060.082.4
GAIA11 / 1773.763.258.0
WebShop10 / 1390.988.987.9

召回高于精度,因为码本长出了人工表没有的类:该动却完全不输出动作、口头说转向实际不转、翻页和重置之间空转。理论叙事收到「不再吃环境反馈、把原错误再演一遍」,和先前专家写的错误级联对得上,只是落在可观察行为而不是内部模块。一次性打码的对照在三个数据集上召回和匹配都更低。

当特征用时,Go-Browse 里「点可见控件」β=-2.59,偏成功;点完不核验就收工 β=+3.28,偏失败。SWE-Agent 里大范围绕过 β=+4.10 偏失败,侦察后写最小复现 β=-1.82 偏成功。预测失败上,码本特征并不总单独赢 few-shot,但和 few-shot 码本拼起来常常最好。GPT-5 在 Go-Browse 上互补特征 MCC 0.499、AUC 0.828。

覆盖裁判是 GPT-5。两人抽查 100 对,互相同意 κ=0.74,和裁判分别是 0.66 与 0.76,裁判偏保守。

为什么重要

想知道 agent 实际在干什么,而不是只看 pass@k,这是一条能跑到几千条轨迹的归纳路径。每条码都能指回原句。适合离线复盘、补训练数据和做过程奖励,不适合在线逐步干预。码本可以当假设交给人审,不宜直接当成行为的地面真值。

局限与存疑

所有编码步骤都是 LLM,跨模型稳定只说明不是某一家的私货,解释不了前沿模型的共有盲区。覆盖数字绑在 GPT-5 裁判上。调用次数多,跑到饱和,不是按条在线用的东西。目前只做了英文、单 agent、成败标签。算法上的饱和也不是方法论原义上的饱和。人工分类对照只覆盖三套带失败标注的数据,另外三套只有成败,理论故事的外部锚更弱。

术语

原文与代码

相关论文

全部论文解读