CritICL: Inference-Time Weak-to-Strong Generalization from Small Language Model Failure Modes
Yufan Wu, Yinghui He, Zhengyi Hu, Lang Wei, Ruichen Li, Qifan Yang, Ting Zhu
cs.CL
2026-08-28
同一家族里大小模型失败分布接近。CritICL 把小模型错题做成批评库再检索进提示。Qwen2.5-72B 静态版总均分 59.2,对齐 Consistency@5 的 59.0,但只生成一次。
推理期想把数学做对,常见办法是多次采样再投票、自我反思、或者另请一个 judge。这些都能加分,但每次请求要跑 3 到 7 遍,token 账单跟着翻。另一条线是弱模型在线给强模型当教练,仍然要为每道新题额外生成。Ohio State 与 Princeton 的观察更省:同一家族里,1.5B 和 72B 会犯同一类错,相对频率还很稳。小模型的错题,本身就是一份可迁移的「别这样想」清单。
CritICL 把这份清单做成离线批评库,推理时当 in-context example 塞进强模型。目标模型权重不动,静态版本每道题只生成一次。
先造 CritBank。用家族内小模型(Qwen2.5 的 1.5B/3B/7B,或 Llama-3.2 的 1B/3B 加 Llama-3.1-8B)对 GSM8K 与 MATH 训练集约 1.5 万题各采 5 条思维链。只留答错的。再用 gpt-4o-mini 给每条错答打最多 5 个失败模式标签,并写一段自然语言批评,相近标签再聚类。库里每条是题目、错答、标签、批评。
推理有两个变体。动态版让目标模型先预测这道题可能踩哪些坑(最多 5 个),再按标签从库里取至多 5 条批评当示例,共两次生成。静态版不看当前题,把小模型的失败分布聚成一张家族画像,按高频坑取固定批评,只生成一次。检索按失败模式对齐,不按题目语义相似。
Qwen2.5-72B-Instruct,Pass@1:
| 方法 | GSM8K | MATH | 总均分 | 生成次数 |
| 5-shot 固定示例 | 93.8 | 80.5 | 56.3 | 1 |
| Consistency@5 | 95.0 | 83.2 | 59.0 | 5 |
| CritICL-static | 95.4 | 84.0 | 59.2 | 1 |
32B 上静态版总均分 49.8,Consistency@7 是 49.5。Llama-3.1-70B 静态版 53.1,Consistency@5 是 51.3。MATH 上 Qwen2.5-32B 的静态版总 token 3768,Consistency@5 是 4814,Self-Reflection 7533。输入因批评变长,输出往往更短(296 对 5-shot 的 308)。
消融把增益钉在「失败模式对齐」上。同样 5 条、同样检索外壳,换成正确例题均分 57.4,通用 GPT 批评 57.7,打乱标签 57.8,完整静态版 59.9。家族内弱模型画像与 72B 的 Spearman 相关 0.91,跨家族掉到约 0.46。MATH 上对最强基线的提升显著(p=0.018),GSM8K 不显著(p=0.083),AMC23 与 AIME 样本小、置信区间很宽,那几个零点几的分差读不成胜负。
这是把弱到强泛化从训练挪到推理的一条便宜路径:批评库建一次,同家族查询可以反复摊。已经在跑 5-shot 的人,把示例从「做对的题」换成「带批评的错题」,多半就能吃到大部分收益,不必上 Consistency@k。适合数学和需要避开固定坑的科学问答;不要指望它替代强化学习或长思维链训练。跨家族、跨领域也能加点,但同家族、同领域仍更强。
论文没有单独的局限节,数字自己会说话。对最强多次采样基线,72B 总均分只高 0.2,主场优势是少生成,不是大幅超车。AIME 级别的分差统计上站不住。CritBank 离线要小模型采样加大模型标注,gpt-4o-mini 与人工的 Cohen's κ 约 0.74,标签有噪声。动态版多一次失败模式预测。权重完全不动,增益是 ICL 量级。GPQA 附录上静态版均分 74.4、Consistency@5 是 71.8,但主实验仍以数学为主。