WFM: Wiki Foundation Model for Complex Agentic Reasoning
Junnan Dong, Linhao Luo, Senlei Zhang, Gong Chen, Taian Guo, Yifei Yu, Rong Tao, Tao Guo, Qian-Wen Zhang, Siyu An, Ruizhi Qiao, Xing Sun
cs.AI
2026-09-16
腾讯优图把实体图和段落做成Wiki Graph,用带方差正则的图注意力做多跳检索,HotpotQA Open准确率89.6,训练步时从2.40秒降到0.23秒。
Agent 要长期记忆,扁平 RAG 切碎上下文,GraphRAG 又把文档压成三元组,语义密度掉一截。业界开始把知识写成带链接的 Markdown,叫 LLM Wiki:段落还在,实体关系也在。用传统图编码器去参数化这种密图,注意力会摊成均匀权重,梯度锁死;跨 GPU 同步边界节点若走 CPU 上的 Gloo/Pickle,拷贝和序列化会把一步训练拖到秒级。腾讯优图实验室、Monash、香港浸会和深圳大学提出 WFM,把 Wiki 图式、注意力聚合和 NCCL 边界交换做成一条训练栈。
Wiki Graph 有两类节点:实体和段落。实体-实体边保留原来的关系类型;实体-段落边是跨层超边,段落不用再被压成一条三元组才能进图。实体用可学习查找表进结构空间,段落用预训练语言模型进语义空间,再线性投到同一宽度。查询先点出种子实体和段落,只在诱导出的局部子图上传播。
关系感知注意力用 \(\pi(v,r,u)=wa^\top\tanh(Wr hu+er-Wr hv)\),在邻居上 softmax 得到 \(\alpha\),再加权聚合。更新是双分支:一路加和,一路逐维相乘,两路 LeakyReLU 后再相加,让结构和文本在同一邻域里竞争。检索放进最多 B 轮的自反思循环,默认 B=4:每轮 TopK 段落累加进证据池,生成器给出候选答案、追问和是否结束的标记;简单题可以提前停,最坏不超过 4 轮,实测平均 2.58 轮。
损失三项:TransE 风格的结构排序、实体-段落 InfoNCE 对齐、注意力 logit 方差的 hinge 下限,方差低于 \(\epsilon\) 才罚。课程先冻图编码器只训对齐,再解冻联合优化,默认 \(\epsilon=0.05\)、\(\lambda2=0.1\)、3 层图注意力。分布式侧把分区边界索引离线算好,padding 成固定形状,训练时 NCCL AllToAll 直接 GPU 对 GPU,不再每步在 CPU 上打包。
生成用 DeepSeek V4 Flash,判分用 DeepSeek V4 Pro,嵌入统一 all-MiniLM-L6-v2,检索深度 20。
多跳问答 Open / Reject 准确率:
| 方法 | HotpotQA | 2Wiki | MuSiQue |
| Youtu-GraphRAG | 86.8 / 80.2 | 87.0 / 77.6 | 65.7 / 47.5 |
| WFM | 89.6 / 84.3 | 90.2 / 82.4 | 69.8 / 52.6 |
相对 Youtu-GraphRAG,Reject 模式分别高 4.1、4.8、5.1 点,说明增益主要在「只能靠检索证据答题」。Recall@20:HotpotQA 93.20、2Wiki 90.15,都是表内最高;MuSiQue 75.24,比 Youtu-GraphRAG 的 75.90 低 0.66。长期记忆上,PersonaMem 总体 58.49、RHELM 52.17,比最强非 WFM 基线高 8.39 和 5.37;去掉自反思仍有 54.12 和 48.90。PersonaMem Recall@20 为 52.63,比 A-mem 的 38.2 高 14.43。
消融:换成普通实体图,多跳平均 Recall@20 掉 7.48,记忆准确率掉 7.68;去掉方差正则或热启动都会伤这两头。强制跑满 4 轮能找回大部分效果,成本升到 1.58 倍。NCCL 边界交换把一步从 2.40 秒打到 0.23 秒,号称 10.5 倍且 bit-exact。
给「Markdown Wiki 当 Agent 记忆」补上可训练的图编码器和能跑起来的通信层。做 Agent 记忆的人可以单独借三件东西:段落当一等节点、注意力方差下限、固定形状的 GPU 边界交换。HotpotQA 相对自家 Youtu-GraphRAG 的提升是几个点的渐进,系统侧 2.40→0.23 秒更值得复用。
实现细节节写明:新补的表格格子和诊断扫描是规划值,对外引用前还要用实测跑数核对。部分主表数字可能尚未从规划变成测量,引用时要把这句话一起带上。生成器和判分都是 DeepSeek V4,和开源 RAG 常用的 GPT 判分不可直接比。Wiki 图怎么从原文自动建成、建错了怎么办,正文几乎没写。记忆评测里 PersonaMem 的召回靠 LLM 裁判。论文模板仍留着 2018 年 Woodstock 占位会议信息,更像内部预印本而不是定稿。未来工作自己也只写到实时动态任务和跨场景泛化,没有部署数字。