反事实校准技能图边权,六模型十二组设置全胜过GoS

CaSKG: Counterfactual-Causal Skill Graphs for Scalable Agent Skill Retrieval

Zhiyuan Li, Linyuan Gao, Xuechun Ding, Hongwei Chen, Yuan Wu, Yi Chang

cs.AI, cs.CL

2026-08-26

CaSKG用删除、替换、调序三种文本反事实探针校准技能图的边,再做任务条件检索:相对GoS,ScienceWorld六模型均分从72.62升到80.50,ALFWorld成功率从80.01%升到86.79%。

这篇在解决什么

LLM agent 的可复用技能库一大,检索就变成主问题。整库塞进提示覆盖全、噪声大;向量检索上下文短,却把技能当成互不相关的文本;图检索能找回流程邻居,前提是边上的相关性靠得住。语义相似、共现、接口能接上,都可以连出一条边,这条边可能只是可替换方案或无序邻居。相关性一旦沿弱边扩散,检索包就被污染。对所有有序技能对做穷尽评估又不现实,边数随库规模按二次方涨。

方法

CaSKG 把构图拆成「高召回发现」和「边置信校准」。先用词面、语义、输入输出兼容、流程位置等信号诱导有向候选图,修复证据和可选 LLM judge 再调分。然后把有限预算分给验证前沿,对每条有向假设打三种文本反事实探针:

探针分用 Beta(1,1) 平滑合成边可靠度 𝑐𝑖𝑗,再按阈值打成 confirmed / uncertain / rejected / unvalidated。通过的边满权发布,不确定的降权,拒绝的删掉,少量未验证边当低权脚手架保覆盖。图离线冻结。运行时用词面和语义种子做个性化 PageRank 式扩展,下游策略和任务接口都不改。

结果

Skill1000、ALFWorld ID-140(140 条,成功率)和 ScienceWorld U211(211 条,官方均分),六种骨干,十二格全是 CaSKG 最高,步数也全面低于 GoS。

骨干ALF GoSALF CaSKGSW GoSSW CaSKG
MiniMax-M2.763.6073.5755.8568.33
GLM-5.295.7197.8680.3385.11
Kimi-K2.693.6095.0076.8283.88
Qwen3.5-397B88.6092.1463.1874.97
DeepSeek-V4-Flash77.8686.4373.4583.40
GPT-5.6-Luna60.7175.7186.0887.33

六模型宏平均:ScienceWorld 72.62→80.50,ALFWorld 80.01%→86.79%。ScienceWorld 均步 16.39→15.29,ALFWorld 15.96→14.05。GPT-5.6-Luna 在 ALFWorld 上 Vector 55.00、GoS 60.71,都低于整库 Vanilla 的 72.86,CaSKG 拉回 75.71:图检索在边不可靠时比不检索更差。

ScienceWorld 24 类任务里,CaSKG 对 GoS 赢 21、平 1、输 2(非生物搜索、温度测量)。消融(MiniMax、ALF、Skill1000):完整 73.57%;只发全部候选 71.43%;去掉 judge 71.43%;只用语义候选 67.14%。库从 200 扩到 2000,CaSKG 对 GoS 的优势都在。MiniMax 在 500 技能时拉开最大,成功率 67.86% 对 GoS 的 45.00%。完整图发布 3292 条边,候选池有 9937 条,说明校准是在做减法。

为什么重要

技能检索的瓶颈在边上,不在库有多大。CaSKG 不改 agent 策略,只换检索图,弱模型和强模型都吃得到。对已经在用 Graph-of-Skills、ToolNet 一类图记忆的人,把「这条边经不经得起删除/替换/调序」做成离线校准,是立刻能插的一层。弱模型上十几个点的提升更实际。

局限与存疑

没有独立 Limitations。探针是对技能描述的文本干预,不是环境里的真干预,LLM 评分当因果证据会有自洽幻觉。图离线冻结,论文把轨迹共现通道留作接口,静态实验没用上。评测全是 ALFWorld / ScienceWorld 文本环境,Skill1000 也是封闭库。构图和探针成本几乎没当一等指标报。GPT-5.6-Luna 的对照说明:校准做错,图检索会明显伤强模型。24 类里两类为负,简单查找任务上多跳扩展可能是噪声。

术语

原文与代码

相关论文

全部论文解读