论文:开头加两个 token,基座模型 MATH-500 从 42% 升到 78%
arankomatsuzaki · x · 2026-10-06
Sophie L. Wang、Amil Dravid 等人(含 Alexei Efros)的论文《Base Models Can Reason By Taking a Cue From Training Data》发现,基座模型的推理能力可以在不训练的情况下被「唤醒」:
- 核心做法:强制预填开头几个 token 即可。在 Olmo-3-7B 前面加 ".\n\n Okay",MATH-500 pass@1 从 42% 升到 78%;Qwen3-14B 加 " Alright," 则从 72% 升到 87%,接近 RL 训练后的水平。
- 机理解释:这些有效开头 token 来自基座模型在预训练数据中学到的联想;RL 后训练的作用之一就是让模型更容易产生这类有效 cue。
- 进一步发现:改变这些数据联想后,连 "Chicken" 这样的词也能触发推理;把 cue 固定下来能恢复 RL 相对基座的大部分性能增益。
- 意义:回应了「基座模型是否已具备推理能力、后训练到底加了什么」的争论,给出了极简的访问方式与数据侧解释,且结果在多个模型家族上成立。论文与代码已开源。
所属事件:研究发现开头token线索可激发基座模型推理媲美RL(5 条相关)→
「模型」频道最新
- Perplexity 开源决策模型登顶 Hugging Face Decision Index 0.3 — AravSrinivas · 2026-10-07
- AutoAWQ 作者:约 4.3 万美元和一个 B300 节点四周可复现 Bonsai 2 — airesearch12 · 2026-10-07
- SuperGrok 用户吐槽 Grok Bot 用量限制太紧:「很快就撞墙了」 — nima_owji · 2026-10-07
- NVIDIA Nemotron Labs 联手 Artificial Analysis 评测开放模型 — NVIDIAAI · 2026-10-07
- Mistral Large 4 一句话生成日式漂浮体素岛,网友惊呼「欧盟回来了」 — kevinkern · 2026-10-07
- Marin 535B-A23B 开源模型训练过半,Percy Liang 分享心得 — ericjang11 · 2026-10-07