Using Grounded Theory for Agent Behavior Analysis at Scale
Zhuoran Lu, Yangyang Yu, Zhuoyan Li, Yibo Meng, Nan Jiang, Chengxi Zang, Jie Gao, Ziang Xiao
EMNLP 2026)
cs.CL, cs.AI
2026-08-31
把社科扎根理论做成多智能体流水线,在六套共七千多条轨迹上归纳行为码本。覆盖人工失败分类 73% 到 91%,拿码本当特征预测失败,并补上 few-shot 漏掉的行为。
Agent 跑完 SWE-bench 只告诉你成了还是挂了。轨迹可能有几百步,人工读不起,预定义失败分类又接不住新任务里冒出来的行为。量化元数据能规模化,但看不见过程。
社科用了六十年的扎根理论:从数据里长出类,而不是拿事先的假说去套。停手的标准叫理论饱和,新样本不再长出新结构。缺口是没人把它做成可审计、可停机的 agent 分析流水线。先前 AcademiaOS、LOGOS 一类系统没有把开放、轴心、理论三层跑完整,也没有真的用饱和当停机条件。
AutoTraceGT 四个角色。OpenCode 对着单条轨迹打 2 到 5 个词的概念码,带上步骤区间和原句证据,长轨迹切块并传备忘。AxialCode 把一批码收成范畴和关系,并标成功、失败或两者都有。Manage 拿新范畴跟总码本做增、并、拆、标,默认能并就并。连续两轮新增范畴低于阈值(实现里 ε=0.2)就宣布饱和。最后 TheoreticalCode 只看饱和码本,抽出核心范畴和叙事,不再加新证据。
评测分两摊。Tau-Bench、Go-Browse、SWE-Agent 各约两千条,只有成败标签。ALFWorld、GAIA、WebShop 带人工失败类型。骨干包括 GPT-4.1-mini、GPT-5、GPT-5-mini 和 GPT-OSS-120B。默认每轮 30 条,开码块 50 条消息。
过程上,新增动作变少、合并确认变多,码本余弦靠近终稿,像饱和该有的样子。同一数据集同一模型的三次独立运行,码本中位余弦 0.929;跨配置 594 对比中位 0.791,95 分位 0.901。同数据集换骨干,覆盖仍高于打乱数据集标签的零假设(置换检验 p<0.001)。
| 数据集 | 人工类 / 机器类 | 召回 | 精度 | 轨迹匹配 |
| ALFWorld | 15 / 20 | 75.0 | 60.0 | 82.4 |
| GAIA | 11 / 17 | 73.7 | 63.2 | 58.0 |
| WebShop | 10 / 13 | 90.9 | 88.9 | 87.9 |
召回高于精度,因为码本长出了人工表没有的类:该动却完全不输出动作、口头说转向实际不转、翻页和重置之间空转。理论叙事收到「不再吃环境反馈、把原错误再演一遍」,和先前专家写的错误级联对得上,只是落在可观察行为而不是内部模块。一次性打码的对照在三个数据集上召回和匹配都更低。
当特征用时,Go-Browse 里「点可见控件」β=-2.59,偏成功;点完不核验就收工 β=+3.28,偏失败。SWE-Agent 里大范围绕过 β=+4.10 偏失败,侦察后写最小复现 β=-1.82 偏成功。预测失败上,码本特征并不总单独赢 few-shot,但和 few-shot 码本拼起来常常最好。GPT-5 在 Go-Browse 上互补特征 MCC 0.499、AUC 0.828。
覆盖裁判是 GPT-5。两人抽查 100 对,互相同意 κ=0.74,和裁判分别是 0.66 与 0.76,裁判偏保守。
想知道 agent 实际在干什么,而不是只看 pass@k,这是一条能跑到几千条轨迹的归纳路径。每条码都能指回原句。适合离线复盘、补训练数据和做过程奖励,不适合在线逐步干预。码本可以当假设交给人审,不宜直接当成行为的地面真值。
所有编码步骤都是 LLM,跨模型稳定只说明不是某一家的私货,解释不了前沿模型的共有盲区。覆盖数字绑在 GPT-5 裁判上。调用次数多,跑到饱和,不是按条在线用的东西。目前只做了英文、单 agent、成败标签。算法上的饱和也不是方法论原义上的饱和。人工分类对照只覆盖三套带失败标注的数据,另外三套只有成败,理论故事的外部锚更弱。