网友推断新模型靠 RL 训练:合成数据用 Kimi 反而更便宜

JoshPurtell · x · 2026-09-03

Josh Purtell 与网友讨论某新模型的训练来源。他反驳「用 sol 合成数据蒸馏」的说法:用 sol 合成数据相比直接用 Kimi k3 或 GLM 5.3 几乎没有优势,后者还更便宜;且训练后模型成绩超过 sol,说明 RL 在其中作用很大。他还指出 SFT+RL 比纯 RL 更难,若真要蒸馏反而说明对方偷懒。这是一条基于成本与成绩反差的训练路线推断。

所属事件:JoshPurtell 拆解模型蒸馏之争:任务类型决定风险与可行性(8 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →