在提示词前加「Okay」可让 Olmo-3-7B 的 MATH-500 准确率从 42% 升至 78%
arankomatsuzaki · x · 2026-10-06
arankomatsuzaki 分享了一个发现:基础模型本身已经具备推理能力,只需从训练数据中「取一个线索」即可激发。
- 在提示词前加上 ".\n\n Okay",可让 Olmo-3-7B 在 MATH-500 上的 pass@1 准确率从 42% 提升到 78%。
- 类似地," Alright ," 可让 Qwen3-14B 从 72% 提升到 87%。
- 其机制:RL 训练使这些风格化线索更有可能出现;将这些线索固定/添加到基础模型中,可以恢复大部分 RL 相对于基础模型所获得的性能提升。
这表明,RL 后训练的一部分效果可能仅仅是在激发基础模型中已存在的推理行为,而不是创造了新的能力。
所属事件:研究发现加起始词即可激发基座模型推理能力(4 条相关)→
「模型」频道最新
- 腾讯开源 Octop:自托管多用户多 Agent 工作台,已获 7.3k Star — udmrzn · 2026-10-06
- 「模型只有数学编码在进步?」AI 小说屡获奖引出能力分化之辩 — erikphoel · 2026-10-06
- Mistral 复苏:每美元智能比拼亮眼,1T 参数比 GLM 5.3 flash 低 3 分 — rickasaurus · 2026-10-06
- 8 个模型同玩俄罗斯方块,Perplexity Decider 决策能力居首 — AravSrinivas · 2026-10-06
- Mistral 新 1T 参数大模型命名 Le Chonk,致敬 X 网友梗 — shaunralston · 2026-10-06
- 开发者实测:Opus 5.5 首次敢把推理档从 Max 降到 High 还信得过输出 — casper_hansen_ · 2026-10-06