网友推断新模型靠 RL 训练:合成数据用 Kimi 反而更便宜
JoshPurtell · x · 2026-09-03
Josh Purtell 与网友讨论某新模型的训练来源。他反驳「用 sol 合成数据蒸馏」的说法:用 sol 合成数据相比直接用 Kimi k3 或 GLM 5.3 几乎没有优势,后者还更便宜;且训练后模型成绩超过 sol,说明 RL 在其中作用很大。他还指出 SFT+RL 比纯 RL 更难,若真要蒸馏反而说明对方偷懒。这是一条基于成本与成绩反差的训练路线推断。
所属事件:JoshPurtell 拆解模型蒸馏之争:任务类型决定风险与可行性(8 条相关)→
「模型」频道最新
- Google 六周内第三款 Flash:Gemini 3.8 Flash 强化 Agent 与编码 — brianryhuang · 2026-09-03
- 俄罗斯团队创 Mostik:让模型用权重「心电感应」,混合模型登顶 ARC-AGI 3 — nordicinst · 2026-09-03
- Anthropic 上线 Claude 文件检测工具,C2PA 凭证一键验证出处 — btibor91 · 2026-09-03
- Marin 535B A23B 训练公开博客与 wandb 指标入口 — Sentdex · 2026-09-03
- 字节开源 LoopLM:循环潜空间推理让 1.4B 模型比肩 12B 竞品,Bengio 参与 — peterjliu · 2026-09-03
- Marin 535B A23B 前沿级训练全程实时公开可追踪 — Sentdex · 2026-09-03