RAG over Thinking Traces Can Improve Reasoning Tasks
Negar Arabzadeh, Wenjie Ma, Sewon Min, Matei Zaharia
cs.IR, cs.AI, cs.CL
2026-05-05
加州伯克利把强推理模型的思维轨迹当 RAG 语料,离线改写成结构化、压缩或诊断式文本。标准 retrieve-then-generate 下,Gemini-2.5-Flash 在 AIME 2025–2026 从 53.3 升到 83.3,相对提升 56.3%,优于网页检索。
RAG 在知识密集型任务上已经是标配:把文档检索进来,给模型补事实。放到数学、代码这类推理任务上,效果就不稳。前人用通用网页语料检索,收益主要落在弱模型上,噪声上下文甚至会把推理带偏。于是行业里形成了一种判断:检索对推理帮助有限。
加州伯克利这组人说,卡点不在检索机制,在语料选错了。网页和教科书擅长给事实,推理需要的是「题是怎么推出来的」。他们把强推理模型解题时吐出的中间思维轨迹当成检索库,再用一个离线改写步骤 T³ 把又长又吵的轨迹压成检索友好的脚手架。推理模型和检索管线都不用改,只换语料。
整条链路分两段,推理时还是标准 retrieve-then-generate。
离线建库。一个 thinker(主实验用 Gemini-2-thinking)在辅助题集上解题,留下原始思维轨迹。再用更便宜的 Gemini-2-Flash-Lite 把每条轨迹改写成三种检索单元:
这三种改写都不依赖测试查询,一次性做完就能反复用。59K 语料上,三种变体合计只要 64.74 美元,单种最多 26.74 美元。
推理时用 e5-base-v2 检索 top-3。原始轨迹按 512 token 切块;改写后的轨迹平均不到 1000 词,按 2048 token 整段检索。检索结果当 hint 拼到题目后面,交给 solver。thinker、改写模型、solver 可以是三个不同模型。
语料有两套。T³-59k 来自 S1 管线,约 59K 题,配 Gemini-2-thinking 轨迹,数学约 53K。T³-114K 来自 OpenThoughts,配 QwQ-32B 轨迹,114K 题(数学 89K、代码 20K、科学 4K、谜题 1K)。评测集用 13-gram Jaccard 去污染,去掉约 1.8%。AIME 2025–2026 本身也晚于源题集发布。
对照包括无检索、随机检索、OpenWebMath(640 万文档)、StackExchange(2980 万)、两套 Wikipedia、GitHub、ArXiv、CompactDS 全库(6.39 亿以上文档,用 DS-Serve 加 Contriever 提供服务),以及 Tavily 实时搜索。通用语料同样切成 512 token、同一套 retriever。
评测三个推理基准:AIME 2025–2026(每年 30 题,Average@8)、GPQA-Diamond(198 题,Average@4)、LiveCodeBench(202 题 pass@1,Average@4)。Solver 是 GPT-5、GPT-OSS-120B、Gemini-2.5-Flash。生成上限 16K token,温度 0.6。
主表最硬的数字在 AIME:
| 设置 | GPT-5 | GPT-OSS-120B | Gemini-2.5-Flash |
| 无 RAG | 86.7 | 78.3 | 53.3 |
| 切块原始轨迹 | 91.7(+5.8%) | 85.0(+8.6%) | 80.0(+50.1%) |
| T³ 最佳变体 | Reflect 93.3(+7.6%) | Semantic 83.3(+6.4%) | Semantic 83.3(+56.3%) |
| 通用语料最好一档 | GitHub 91.7 | CompactDS 80.0 | GitHub / Tavily 60.0 |
完整原始轨迹经常不如切块:GPT-OSS-120B 在 AIME 上从 78.3 掉到 73.3。网页语料更不稳定,OpenWebMath 把 GPT-OSS-120B 的 AIME 打到 63.3(相对 -19.2%),把 LiveCodeBench 打到 37.6(相对 -35.1%)。6.39 亿文档的 CompactDS 也没有全面压过 5.9 万条轨迹。
GPQA-Diamond 上,T³-Struct 把 GPT-5 从 83.8 推到 87.4,把 Gemini-2.5-Flash 从 77.3 推到 80.8;T³-Semantic 把 GPT-OSS-120B 从 70.7 推到 74.7。LiveCodeBench 上,T³-Struct 把 GPT-OSS-120B 从 57.9 推到 61.4。科学和代码上的涨幅明显小于数学,语料本身就偏数学。
对照实验还拆了两件事。检索最终答案弱于检索思维过程,AIME 上三条模型都是轨迹赢;Gemini-2.5-Flash 在 GPQA 和 LiveCodeBench 上检索答案略好。同一套 59K 题,thinker 换成 Gemini-2-thinking 始终最好;换成 GPT-OSS-120B 自己的轨迹,GPT-5 的 GPQA 从 83.8 崩到 52.0,Gemini-2.5-Flash 的 AIME 从 53.3 掉到 45.0。轨迹怎么写,比题集本身更关键。
更大的 T³-114K 改写后,在 AIME 和 GPQA 上多数设置反而弱于 T³-59K。语料规模不是主因,题集风格和目标基准的对齐才是。
成本侧按三个基准平均:GPT-5 准确率从 76.14 到 80.53,每题从 1.22 美分降到 1.04 美分,便宜 14.8%;GPT-OSS-120B 从 68.99 到 74.82,每题 0.10 降到 0.09 美分。Gemini-2.5-Flash 用 T³ 会比无检索更贵,但仍比塞完整轨迹便宜,准确率也更高。一篇 AIME 2026 案例里,Gemini-2.5-Flash 无检索 8 次全没写完,T³-Reflect 后 7 次做对。
对要上推理系统的人,这是一条不用重训、不用改 serving 拓扑的增益路径。现有 RAG 栈可以直接换语料:把强模型已经付过钱的 thinking tokens 存下来,离线改写一次,推理时当 hint 喂进去。弱 solver 吃到的相对收益最大,但 GPT-5 在 AIME 上仍能从 86.7 到 93.3。
它和 Buffer of Thoughts、Retrieval-of-Thought、Retrieval-Augmented Thoughts 走的不是同一条路。那些方法在推理时要做模板实例化、图遍历或逐步改写思维链。T³ 把复杂度全部推到离线建库,推理时就是普通 top-k 检索。部署成本更接近「换一个 index」,离「换一套 agent 控制器」更远。
这是语料选择上的一次打法纠正,不是新的推理算法。数学上证据最硬,代码和科学问答是跟跑。
论文自己写了三条。只测了 vanilla RAG,没做迭代检索、自适应检索或推理中途再检索。语料严重偏数学,GPQA 和 LiveCodeBench 涨幅有限可能就是这个原因。thinker 效应没有完全拆开:没有「同一题集、很多 thinker、同一 solver」的全交叉对照。
读下来还有几处站不稳。最佳改写策略随任务和模型变,Struct、Semantic、Reflect 没有一个通吃,线上要做验证集选型。完整轨迹会伤 GPT-OSS-120B,thinker 选错会大幅倒退,轨迹库不能当免费午餐。去污染用的是 13-gram Jaccard,语义相近但字面不同的题仍可能漏网。AIME 一共 60 题、Average@8,相对百分比 +56.3% 看着很大,分母是 53.3 的弱基线,绝对分是 +30.0。成本数字用的是三基准平均,单任务是否同样省钱没有拆开报。