Thinking Without Words: Efficient Latent Reasoning with Abstract Chain-of-Thought
Keshav Ramji, Tahira Naseem, Ramón Fernandez Astudillo
cs.CL
2026-04-25
IBM给指令模型加64个保留token当潜空间草稿纸,瓶颈SFT热身后用GRPO优化。Qwen3-8B在MATH-500用144 token拿到90.8分,相对口头CoT最多省11.6倍推理token。
长口头 CoT 能做对题,推理时又贵又慢,RL 轨迹也被撑得很长。连续隐状态方案(如 Coconut)更短,但成绩通常落后口头推理。IBM Research 问的是:能不能在后训练里塞进一套人读不懂的离散「草稿纸」,既短又接近口头 CoT 的分数。
给词表加 M=64 个保留 token,外加 <beginabstract> / <endabstract>。推理时模型最多写 mmax=128 个抽象 token,这段用约束解码,只能从码本里取,写完再自由生成答案。
冷启动行不通:新 embedding 是随机的。热身做成两步循环,共 T=3 轮。首轮抽象序列按口头 CoT 的步骤数从码本里均匀乱抽,论文试过按字母循环和人为幂律,均匀最好。后续轮改成约束解码的 on-policy 样本。答案对口头 CoT 的依赖只能经过抽象隐状态,通道容量大致随长度 m 线性涨,所以 mmax 既是压缩旋钮,也是热身期的信息上限。第一步把口头 CoT 和抽象序列拼在一起做 SFT,但答案的注意力看不到口头 CoT,只能看见抽象段,逼着这几十个位置把解题信息压进去。第二步扔掉口头 CoT,让模型只靠题目生成抽象序列,再对着标准答案做自蒸馏。热身数据来自 Dolci-Think-SFT 的 60 万条。
之后用 GRPO 做热启动 RL,共 100 万条 episode,奖励来自生成式裁判 gpt-oss-20b,更新同时覆盖抽象段和答案。训练过 Qwen3-8B、Qwen3-4B 和 Granite-4.0-Micro(3B)。SFT 用 8 张 H100,RL 最多 32 张。码本默认 64,附录扫过 1 到 512。
Qwen3-8B 主表(生成 token 含推理+答案):
| 方法 | MATH-500 | AlpacaEval | HotpotQA |
| SFT+RL 口头 CoT | 92.6 / 1671 | 58.4 / 496 | 58.1 / 735 |
| Abstract-CoT 热身+RL | 90.8 / 144 | 60.8 / 225 | 58.8 / 171 |
MATH 上压缩 10.4-11.6 倍,AlpacaEval 1.9-2.2 倍,HotpotQA 4.0-4.3 倍。AlpacaEval 高 2.4 分,HotpotQA 高 0.7,MATH 低 1.8 分。Qwen3-4B 上 Abstract-CoT 为 MATH 89.8 / 141、AlpacaEval 58.7 / 213、HotpotQA 53.8 / 169,对照口头 SFT+RL 的 91.2 / 1523、57.1 / 467、53.4 / 683。Granite 3B 的 MATH 从 73.8 / 1587 到 74.4 / 153,AlpacaEval 从 31.97 到 33.54。更难的 GPQA-Diamond 为 50.5 / 174,对照口头 SFT+RL 的 51.5 / 1382(约 7.9 倍);AIME'25 为 24.4 / 3438,对照 25.6 / 9343(约 2.7 倍)。
只做冷启动 RL 或只做热身都不够。Pause token 把长度压到和 Abstract-CoT 相近,分数却掉到基线以下,短并不等于会推理。逐步内化 CoT 要 22 轮迭代,算力更重,分数仍落后这套。RL 过程中抽象词表出现幂律,<TOKENF> 被用得特别频繁。打乱抽象序列,MATH 从 90.6 掉到 82.8;截到 32 token 掉到 84.6,口头 CoT 同样截断会掉 11.8 分。
这是纯后训练的离散潜空间推理,不必继续预训练,也不必把隐状态喂回下一层。服务侧可以卡死中间长度,还保留一段可审计的离散轨迹。代价是人读不懂。MATH 上没有超过口头 CoT,省的是 token,不是把难题做对更多。
11.6 倍主要来自 MATH,AIME 仍要三千多 token。热身仍要教师口头 CoT,并不是从零学会抽象语言。奖励模型是 gpt-oss-20b,非可验证任务等于用另一个模型打分。评测关掉了 Qwen3 自带的 thinking mode,和线上长思考不是同一设置。论文自己也写,固定小预算可能撑不住长程推理。