推理到一半去查相似题塞进思维链,AIME 2025 相对涨 60%

ThinkRetrieve: Retrieval-Augmented Reasoning Traces for Test-Time Scaling

Vaibhav Singh, Soumya Suvra Ghosal, Sarvesh Gharat, Soumyabrata Pal, Ramasuri Narayanam, Dinesh Manocha

cs.AI

2026-08-11

ThinkRetrieve 在推理每一步检索相似已解题注入思维链,五个模型四个基准全胜,AIME 2025 最高相对提升 60%。

这篇在解决什么

大推理模型(Large Reasoning Model)靠「想得更久」来换更高的分数,给它更多推理预算,让它生成长思维链。但最近一批研究发现,这种顺序式 test-time scaling 有递减甚至反作用:思维链越长,不确定性越高、错误累积、跑题越严重。在 AIME 2025 这种难题上,顺序 TTS 在 22% 左右就卡住,再加预算也不涨。

方法

ThinkRetrieve 的做法是:在推理的每一步,动态检索一个相似的、已经解开的例题,塞进当前思维链里。和普通 RAG 的区别在于,它检索的是「怎么推理」的范例,不是「相关事实」。

每步的流程是:模型先正常往下推理,在步骤边界产出一个中间答案;把原始问题和这个中间答案拼成查询,用 E5-Large 在一个例题库里做近邻检索;把检索到的例题格式化成 [Example: 问题 Solution: 解法] 直接拼进思维链;模型带着这个范例继续往下推。

例题库从 NuminaMath-1.5 的合成部分筛出约 30 万条,经过两阶段去污染(精确匹配加余弦相似度 0.90 过滤),确认跟四个测试集零重叠。

结果

在五个推理模型(DeepSeek-R1-Distill-Qwen-1.5B 到 Qwen3-8B)和四个基准(GSM-8K、MATH-500、AIME 2025、SciQ)上,ThinkRetrieve 在每一个(模型 × 基准)格子上都赢了顺序 TTS。最大增益在最难的 AIME 2025:

模型顺序 TTS → ThinkRetrieve
Qwen3-1.7B22.2% → 35.6%(+13.4 绝对,60% 相对)
Qwen3-4B64.4% → 66.7%
Qwen3-8B68.9% → 71.1%

在 GSM-8K 上,DeepSeek-R1-1.5B 的顺序 TTS 在预算加到 22K token 时从 83% 崩到 52%,ThinkRetrieve 稳在 84%。算力对齐对比里,在 MATH-500 子集上单次 ThinkRetrieve(0.47)超过自洽采样 k=8(0.20)。代价是每步多一次检索调用,wall-clock 多约 6%。

为什么重要

test-time scaling 现在是大家都在挤的方向,而「想更久」已经撞墙。这篇给了一条不同的路:与其让模型自己越想越长,不如在它卡住时递一份现成的解题范例。每步检索的设计比静态 RAG(只在开头塞几个例子)更准,因为检索能跟着推理进程走。方法本身不绑死数学,任何能攒出一个高质量例题库的推理任务都可能套用。

局限与存疑

效果高度依赖例题库的覆盖:遇到分布外的问题,检索到的范例可能不相关甚至误导,而 ThinkRetrieve 降低预测熵的特性反而会把模型死死钉在一个「自信的错误答案」上。作者承认每步检索带来约 6% 延迟,且无法完全排除两个问题表面不同、解法相同这种潜在结构泄漏。在代码生成、开放逻辑推理这类难建高质量例题库的任务上是否还有效,是开放问题。

术语

原文与代码

社区讨论

相关论文

全部论文解读