推理压缩不伤能力
marcodsn · reddit · 2026-07-13
### 核心结论 作者围绕“推理压缩(reasoning compression)”做了一系列小规模训练实验,目标是在**不破坏推理能力**的前提下,减少模型输出的 reasoning token。 ### 主要发现 - **整段压缩会导致贪心解码失效**:把完整推理轨迹统一压成简短风格后,模型在 GSM8K 上大量出现循环,温度 0 时准确率几乎崩掉;但提高采样温度后又能恢复,说明问题主要出在“不会停”,而不是学不会。 - **分段感知压缩有效**:保留计算与验证片段,只压缩/删除叙述过渡部分后,模型在 GSM8K 上不仅没掉点,反而比未压缩的 SFT 对照更好,同时 reasoning token 约减少 1.7 倍。 - **系统提示词的含义会被训练重塑**:对原模型,“请逐步推理”更像“想更久”;对压缩训练后的模型,它会变成一种“效率触发器”。但如果训练时就带着这个 prompt,模型会对它产生依赖,所以作者认为更好的做法是:**训练时不用,部署时再加**。 - **压缩可以做成开关**:用 identity prompt 绑定压缩风格后,开启 prompt 时输出更短;关闭 prompt 时模型会“解压”回更长的推理长度,而准确率保持正常。 - **更强教师不一定更好**:用更大的模型先切分/转换轨迹,数据看起来更干净,但训练出来的模型反而不如直接用原始分布附近的数据。 - **代码域有“代码税”**:Qwen 的代码轨迹本来就更偏计算,压缩几乎碰不到;在代码任务上,压缩训练反而拉长了思考并伤害 HumanEval/MBPP。Gemma 上则相反,代码被压得更厉害,HumanEval 反而明显提升。 - **可迁移到别的模型家族**:同样流程迁移到 gemma-4-12b-it 后,压缩模型在 GSM8K 上以更少 token 达到更高准确率,并且在各个采样温度下都优于原始模型。 ### 规模与资源 - 每个训练分支只有约 **322–648** 条样本 - 每个分支约 **1.5k 3090 小时** - 作者计划继续扩到更大规模数据集 ### 相关资源 作者提供了完整论文式总结、模型/数据集集合与代码。
「研究」频道最新
- 长运行模型能解难题,也会暴露短评测看不到的风险 — polynoamial · 2026-07-21
- 作者称 AI 目前最偏向懂行用户,相关新论文引热议 — Afinetheorem · 2026-07-21
- Generative Bionics 六个月把 Gene.01 做成可用人形平台 — lukas_m_ziegler · 2026-07-21
- 南京大学提出 L0–L7 具身世界模型评估梯度 — jiqizhixin · 2026-07-21
- Anthropic 为罕见病研究者提供最高 5 万美元 Claude 额度 — AnthropicAI · 2026-07-21
- 激活感知量化提升 GPQA 准确率,但也拖慢 Gemma 3 4B QAT — devildip · 2026-07-21