研究发现:选对开头 token,base 模型推理可媲美 RL 训练效果
RulinShao · x · 2026-10-07
一组研究者发现,base 模型只要用对「开头 token」(token cues),就能获得与 RL 训练相当的大部分推理收益。这些 cue 因模型而异,可以简单到 ".\n\nOkay," 或 "To determine,",无需任何显式要求推理的指令。
关键发现
- 通过对 RL 训练和 base 模型训练数据的干预实验剖析了这一现象
- token cues 源于推理相关训练数据中的简单关联
- 通过反事实 mid-training 数据编辑,甚至能把 "chicken" 这个词变成有效的推理 cue
- 还将分析扩展到拒绝/合规的安全案例研究
该工作揭示了一种丰富的潜在现象学:RL 的部分推理增益可能只是让模型学会在开头「进入推理模式」。
所属事件:MIT研究:合适的开头token可让基座模型推理媲美RL训练(6 条相关)→
「研究」频道最新
- HAIPS@COLM 2026 工作坊聚焦语言模型的人本隐私与安全 — tianshi_li · 2026-10-07
- CUAWright 论文:只用终端命令,computer-use agent 胜过 GUI 方案 — ysu_nlp · 2026-10-07
- AI 年度十佳论文揭晓:Rulin Shao 一人独占两篇,皆为一作 — ShayneRedford · 2026-10-07
- Paradigm 发布数学推理模型:7 项高难基准评测套件全开源 — tensorqt · 2026-10-07
- Paradigm 揭秘后训练关键:程序生成+LLM 出题的互补合成数据组合 — tensorqt · 2026-10-07
- Paradigm RL 训练细节:用价值模型解决 credit assignment,上下文扩至 131k — tensorqt · 2026-10-07