DiagEvo用失败原因当课程,8B数学平均72.3%

DiagEvo: Diagnosis-Guided Self-Evolution via Hierarchical Error Memory

Xincheng Wei, Yifan Ding, Yoshua Li, Dongsheng Ma, Rongxiang Weng, Xunliang Cai, Wenjian Ding, Yao Zhang

cs.AI

2026-09-01

从求解器失败轨迹里抽出错误原因,写入分层记忆再指导下一轮出题。Qwen3-8B五项数学平均72.3%,比R-Zero高4.5点,九项总平均也超过带外部资源的DARC。

这篇在解决什么

自博弈让挑战者出题、求解器答题,两边轮流更新,可以在没有人工标注的情况下把推理做上去。没有方向时,题会越出越长,求解器却停在原地。已有无标签方法用难度、可学性、多样性来控题,这些信号说的是难不难、杂不杂,说不清下一轮该练哪一类错。带指导的方法又要外面的题库、文档或难度标签,课程不在自博弈回路里。

DiagEvo的判断是:方向已经在求解器自己的失败轨迹里。美团LongCat团队把它抽成可复用的错误原因,写进分层记忆,再拿去指导下一轮出题。

方法

每轮四步。挑战者按记忆混合出题:一部分自由探索,一部分对准仍处于 Active 的错误原因;同一技能节点下还可以把 Active 原因和已经 Mastered 的原因缝在一道题里。Active 失败越多,对准出题的比例越高;某个原因被判定掌握后,计数清零,概率再还给自由探索。

出完题,求解器先采样一组回答做伪标签。双重置信过滤留下中等难度、且第一名票数明显领先第二名的题,默认相对阈值 τ=1.6。剩下的题用 GRPO 再采一组优化轨迹。失败轨迹交给诊断器:拿一条和伪标签不一致的推理,对比一条一致的,找出最早分叉,写成可迁移的错误原因。

记忆分两层。下层是错误原因,带 Active/Mastered 状态和当前活跃回合的复发次数;上层是技能节点,把相近原因归在一起。诊断器默认是冻结的 Qwen3-4B-Instruct-2507,负责抽取、去重、归类。求解器只看见题和伪标签,看不见记忆。

结果

默认4B诊断器时,三套求解器在九项基准的总平均都高于全部对照。Qwen3-8B 上,五项数学平均72.3%,比无标签的 R-Zero 高4.5点,比用了外部资源的 DARC 高1.2点;四项综合推理38.8%,分别高2.6和1.0点;九项总平均57.4%,比 DARC 高1.1点。Qwen3-4B 和 OctoThinker-8B 的总平均是53.5%和41.9%,都比 DARC 高1.3点。

诊断器从4B换到235B-A22B,数学平均大约只再涨1.0到1.2点,综合推理几乎不动。默认4B已经够用。

消融在 Qwen3-8B 上最清楚。冻住挑战者,数学平均掉到68.5,相对完整72.3差3.8点,是最大一刀。纯自由探索69.5,只对准出题70.1。去掉相对置信约束后数学平均70.9,无过滤是69.4。同技能节点内的跨状态缝合比随机配对高1.0点。

共演化也不单调。前五轮数学平均一路升到72.3,第6、第7轮掉到72.0和71.4,所以报告用的是第5轮检查点。纯自由探索第3轮就见顶,峰值69.5。记忆规模从151条原因长到244条,技能节点大约36个后稳住。伪标签与oracle一致率:只有绝对置信时从83%掉到65%;加上记忆到72%;再加相对置信到75%。

为什么重要

自博弈缺的往往不是「再难一点」,是「下一轮练什么」。DiagEvo把失败史做成课程信号,不依赖题库和文档,却在总平均上超过了带外部资源的 DARC。4B诊断器就够用,说明贵的不在诊断器规模。

求解器只在数学题上训练,综合推理也跟着涨。这是迁移,不是在综合任务上重新建课。

局限与存疑

双重过滤看的是求解器内部一致性,不是标准答案。大家一起错、票数又集中,伪标签仍会过关。轮数是事先定的,第5轮之后开始回落,论文没有给出自动停训规则。课程只从数学题里长出来,综合基准上的增益不能当成其他领域也能直接建课的证据。部分基线数字引自 DARC,不是全部自己复现。

术语

原文与代码

相关论文

全部论文解读