MIT:固定起始token让基础模型追平RL版,MATH-500从42%到78%
MIT · hf · 2026-10-06
基础模型的推理能力来自训练数据的提示线索
MIT 这篇论文研究训练数据如何在基础模型响应开头的 token 与后续推理行为之间建立关联,结论颇具颠覆性:
- 固定起始 token 线索即可让基础模型媲美 RL 训练版本:如线索 .\n\nOkay 将 Olmo-3-7B 的 MATH-500 pass@1 从 42% 提到 78%,Alright, 将 Qwen3-14B 从 72% 提到 87%;
- RL 的作用是让这些线索更可能出现,而固定线索能恢复 RL 相对基础模型的大部分增益;
- 通过因果数据干预,可以把任意词(如 "chicken")改造成有效推理线索,或移除已有线索的作用;类似编辑能让 "Think duck duck goose" 达到与 "Think step by step" 同等的推理激发效果;
- 不同线索诱导的隐状态表示与训练集中不同文档类型相关;
- 案例研究延伸到安全领域:不同线索激发不同的拒绝/顺从行为,对应不同类型的训练数据。
「研究」频道最新
- GPU 并行不等于随机数生成器:blelbach 反驳大模型非确定性论 — blelbach · 2026-10-06
- 谷歌 AIM 论文:给研究 Agent 建"想法地图",提速 3.1 倍逼近最优 — rohanpaul_ai · 2026-10-06
- 三星提出 FLaRe:流匹配潜空间推理,1/4 延迟达到显式 CoT 97% 准确率 — SamsungResearch · 2026-10-06
- Foil 方法让循环 MoE 翻倍专家数,百B token 预训练损失降 0.012 nat — Shouren Wang · 2026-10-06
- 139 篇语义决策引擎研究系统化:仅 4 篇用匹配实测支撑实时性宣称 — Delong Li · 2026-10-06
- 6G Open RAN 实测:Jev 决策模型 99.8% 达成 1 秒预算,托管 LLM 最低 0% — Delong Li · 2026-10-06