CaSKG: Counterfactual-Causal Skill Graphs for Scalable Agent Skill Retrieval
Zhiyuan Li, Linyuan Gao, Xuechun Ding, Hongwei Chen, Yuan Wu, Yi Chang
cs.AI, cs.CL
2026-08-26
CaSKG用删除、替换、调序三种文本反事实探针校准技能图的边,再做任务条件检索:相对GoS,ScienceWorld六模型均分从72.62升到80.50,ALFWorld成功率从80.01%升到86.79%。
LLM agent 的可复用技能库一大,检索就变成主问题。整库塞进提示覆盖全、噪声大;向量检索上下文短,却把技能当成互不相关的文本;图检索能找回流程邻居,前提是边上的相关性靠得住。语义相似、共现、接口能接上,都可以连出一条边,这条边可能只是可替换方案或无序邻居。相关性一旦沿弱边扩散,检索包就被污染。对所有有序技能对做穷尽评估又不现实,边数随库规模按二次方涨。
CaSKG 把构图拆成「高召回发现」和「边置信校准」。先用词面、语义、输入输出兼容、流程位置等信号诱导有向候选图,修复证据和可选 LLM judge 再调分。然后把有限预算分给验证前沿,对每条有向假设打三种文本反事实探针:
探针分用 Beta(1,1) 平滑合成边可靠度 𝑐𝑖𝑗,再按阈值打成 confirmed / uncertain / rejected / unvalidated。通过的边满权发布,不确定的降权,拒绝的删掉,少量未验证边当低权脚手架保覆盖。图离线冻结。运行时用词面和语义种子做个性化 PageRank 式扩展,下游策略和任务接口都不改。
Skill1000、ALFWorld ID-140(140 条,成功率)和 ScienceWorld U211(211 条,官方均分),六种骨干,十二格全是 CaSKG 最高,步数也全面低于 GoS。
| 骨干 | ALF GoS | ALF CaSKG | SW GoS | SW CaSKG |
| MiniMax-M2.7 | 63.60 | 73.57 | 55.85 | 68.33 |
| GLM-5.2 | 95.71 | 97.86 | 80.33 | 85.11 |
| Kimi-K2.6 | 93.60 | 95.00 | 76.82 | 83.88 |
| Qwen3.5-397B | 88.60 | 92.14 | 63.18 | 74.97 |
| DeepSeek-V4-Flash | 77.86 | 86.43 | 73.45 | 83.40 |
| GPT-5.6-Luna | 60.71 | 75.71 | 86.08 | 87.33 |
六模型宏平均:ScienceWorld 72.62→80.50,ALFWorld 80.01%→86.79%。ScienceWorld 均步 16.39→15.29,ALFWorld 15.96→14.05。GPT-5.6-Luna 在 ALFWorld 上 Vector 55.00、GoS 60.71,都低于整库 Vanilla 的 72.86,CaSKG 拉回 75.71:图检索在边不可靠时比不检索更差。
ScienceWorld 24 类任务里,CaSKG 对 GoS 赢 21、平 1、输 2(非生物搜索、温度测量)。消融(MiniMax、ALF、Skill1000):完整 73.57%;只发全部候选 71.43%;去掉 judge 71.43%;只用语义候选 67.14%。库从 200 扩到 2000,CaSKG 对 GoS 的优势都在。MiniMax 在 500 技能时拉开最大,成功率 67.86% 对 GoS 的 45.00%。完整图发布 3292 条边,候选池有 9937 条,说明校准是在做减法。
技能检索的瓶颈在边上,不在库有多大。CaSKG 不改 agent 策略,只换检索图,弱模型和强模型都吃得到。对已经在用 Graph-of-Skills、ToolNet 一类图记忆的人,把「这条边经不经得起删除/替换/调序」做成离线校准,是立刻能插的一层。弱模型上十几个点的提升更实际。
没有独立 Limitations。探针是对技能描述的文本干预,不是环境里的真干预,LLM 评分当因果证据会有自洽幻觉。图离线冻结,论文把轨迹共现通道留作接口,静态实验没用上。评测全是 ALFWorld / ScienceWorld 文本环境,Skill1000 也是封闭库。构图和探针成本几乎没当一等指标报。GPT-5.6-Luna 的对照说明:校准做错,图检索会明显伤强模型。24 类里两类为负,简单查找任务上多跳扩展可能是噪声。