在提示词前加「Okay」可让 Olmo-3-7B 的 MATH-500 准确率从 42% 升至 78%

arankomatsuzaki · x · 2026-10-06

arankomatsuzaki 分享了一个发现:基础模型本身已经具备推理能力,只需从训练数据中「取一个线索」即可激发。

这表明,RL 后训练的一部分效果可能仅仅是在激发基础模型中已存在的推理行为,而不是创造了新的能力。

所属事件:研究发现加起始词即可激发基座模型推理能力(4 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →