A Model with No Head and Many Thoughts
Nikita Koriagin, Yaroslav Aksenov, George Bredis, Gleb Gerasimov, Nikita Balagansky, Daniil Gavrilov
EMNLP 2026
cs.LG, cs.CL
2026-09-01
T-Tech 提出 Soft Latent Thinking:推理时用约 1.2 万维投影器替换 15 万维词表头,在连续嵌入空间滚动思考。Qwen-1.5B 平均 pass@32 从 SofT-GRPO 的 85.18 升到 86.22,单步更便宜,Mean@1 反而下降。
Soft thinking 已经把中间推理从离散 token 换成词嵌入的加权混合。Zhang 等人 2025 年那套,每一步仍要先过完整词表头,得到大约 15 万维的分布,再按概率把所有 token 嵌入掺在一起。长 CoT 里这一步又贵,又把潜状态锁在词嵌入张成的空间里。
SofT-GRPO 用 Gumbel-Softmax 给这条路加了随机性,才能拿 GRPO 做策略梯度。词表头还在。T-Tech 问得更窄:推理阶段能不能把词表头整个拿掉,换成一个小投影器,训练流程还走同一套 Gumbel-GRPO。
Soft Latent Thinking(SLT)只改推理算子,最终作答仍走原来的 LM head。
每一步取最后一层隐状态,线性编码器压成 K 维 logits,在这 K 个方向上做 Gumbel-Softmax,线性解码器把混合权重映回嵌入空间,当作下一步输入。K 取 8 倍隐维度:Qwen-1.5B 是 12288,LLaMA-3.2-3B 是 24576。相对 15 万维词表,投影这一步大约便宜 5 到 10 倍。
初始化按领域高频词拷贝。OpenThoughts-114k 数学子集里最频的 K 个 token,对应 LM head 行进编码器、embedding 行进解码器,拷完解绑,跟 LoRA 一起训。骨干冻住,LoRA rank 64 打在全部 attention 和 MLP 上,数据是 DeepScaleR,奖励只看对错。
停思考的判据很土:软嵌入跟 </think>(LLaMA 上用 \boxed)的余弦相似度过阈值,就切回普通解码。中间步骤这个相似度通常低于 0.2,靠近作答时会陡升,阈值因此不那么敏感。
策略梯度不给软嵌入本身赋密度,给的是采样时存下来的 Gumbel 变量的似然。SofT-GRPO 同一招,只是把 V 换成 K。
主表覆盖 AIME24/25、AMC23、MATH-500、GSM8K。@1 是 32 次采样的平均 Pass@1,后面两列是 Pass@16 和 Pass@32。
| 方法 (Qwen-1.5B) | Mean@1 | pass@16 | pass@32 |
| 离散 CoT 未微调 | 58.09 | 80.54 | 83.23 |
| 离散 GRPO | 61.28 | 80.16 | 82.39 |
| SofT-GRPO | 61.39 | 83.54 | 85.18 |
| SLT | 57.32 | 82.66 | 86.22 |
摘要写「所有 k 都提升」。主表对不上。Qwen-1.5B 上 SLT 的 Mean@1 是 57.32,SofT-GRPO 是 61.39,离散 GRPO 是 61.28,未微调离散 CoT 都有 58.09。赢在覆盖:平均 pass@32 到 86.22,SofT-GRPO 85.18,基座 83.23。LLaMA-3.2-3B 同样的形状,Mean@1 从 SofT-GRPO 的 32.83 掉到 26.58,pass@32 从 57.06 升到 60.70。
轨迹更短。Qwen 五套平均,SofT-GRPO 6517 token,SLT 6073;只算做对的题,5832 对 4644。AIME2024 上做对的那部分从 10756 掉到 7006。
消融把因果钉住了。推理时只剪词表、不一起训,AIME2024 pass@32 从全词表 soft thinking 的 70.0 掉到 63.3。只训投影器、骨干完全冻住,pass@32 只有 70.0,还不如基座的 73.3。K=1536 太窄(66.7),K=6144 单次最好(AIME Mean@1 29.7)但 pass@32 仍 66.7,K=12288 才把 pass@16/32 拉到 74.3/80.0。
域外更直白。数学投影器开着,HumanEval pass@32 从 SofT-GRPO 的 94.5 掉到 87.2;关掉投影器、留着一起训过的 LoRA,回到 92.7。GPQA Diamond 开着 95.5、关掉 97.0,科学符号跟数学重叠,伤得轻。
Qwen3.5-9B 只做了未调参的 AIME2024 试探:投影器 pass@1 68.4 对基座 76.4,pass@32 都是 93.3,平均 token 9288 对 23292。方向一样,不能当缩放结论。
词表投影大约便宜 5 倍,attention 和 MLP 还在。mini-SGLang 原型上 decode 大约 1.05 倍;Llama-3.1-8B、batch 4 时 1.256 倍,是表里最乐观的一格。
给「本来就要采很多条」的场景:RL 训练、pass@k、best-of-n。单次作答别用,Mean@1 是退步。
工程上可插拔。域内开投影器换覆盖和更短轨迹,域外关掉,LoRA 还在。骨干不用全参微调。
它没有证明连续思考一定强过离散 token。它证明的是:在 soft thinking 加 GRPO 这条线上,把词表头换成压缩投影器,会牺牲单次精度,换来多样性和更便宜的推理步。
作者承认投影器按数学高频词初始化,开着会伤跨域。HumanEval 掉点写进了正文。PCA/SVD 初始化早期实验很差,有用的推理轨迹不像全局高方差子空间。
停思考阈值没有完整扫描。9B 只有一组未调参数字。Coconut 那种直接回灌隐状态的路线没有对照。
摘要和主表打架。摘要说所有 k 的 pass@k 都升,表里 Mean@1 明确低于 SofT-GRPO 和离散 GRPO。后文自己改口,说赢的是多样性和高 k 覆盖。信表。
端到端加速大约 5%。瓶颈若不在词表头,换投影器几乎看不见。