研究发现:选对开头 token,base 模型推理可媲美 RL 训练效果

RulinShao · x · 2026-10-07

一组研究者发现,base 模型只要用对「开头 token」(token cues),就能获得与 RL 训练相当的大部分推理收益。这些 cue 因模型而异,可以简单到 ".\n\nOkay," 或 "To determine,",无需任何显式要求推理的指令。

关键发现

该工作揭示了一种丰富的潜在现象学:RL 的部分推理增益可能只是让模型学会在开头「进入推理模式」。

所属事件:MIT研究:合适的开头token可让基座模型推理媲美RL训练(6 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →