美国实验室更偏 RL,中文实验室更偏成功轨迹 SFT
goyalshaliniuk · x · 2026-07-22
这条帖子在讨论不同实验室的训练范式差异:
- 作者认为,美国 AI 实验室更常用 RL。
- 中文实验室更常用基于成功轨迹的 SFT,而且同样可以很有竞争力。
- 他把 Kimi K3 当作一个“软证据”,用来支撑这个判断。
这不是正式结论,但属于对推理模型训练路线的有信息量观察。
所属事件:中美大模型训练路径分化:美国重RL,中国偏好SFT(4 条相关)→
「研究」频道最新
- 细胞治疗公司收购 STEM-PD,拿临床验证生物基础模型 — arjunrajlab · 2026-07-22
- Token 级约束解码可将 JSON 解析错误压到零 — demirtasfurkan_ · 2026-07-22
- 前沿 LLM 1.6 年合成交易回测全亏了钱 — Scobleizer · 2026-07-22
- 2025 年一篇论文再提 Jacobian Conjecture 争议 — littmath · 2026-07-22
- RAND 发布首份算法洞察保护路线图 — Scobleizer · 2026-07-22
- 生数科技称通用世界模型将驱动视频、机器人和智能体 — 生数科技 · 2026-07-22