Steve Hsu:DeepSeek 效率来自架构创新,蒸馏只是次要因素
jedisct1 · x · 2026-09-12
Steve Hsu 转发回应称,非技术人士(及有意识形态倾向的技术人士)过度强调蒸馏,忽视了只有中国实验室公开发表的模型架构创新。像 DeepSeek V4.1 这样的模型效率主要来自架构本身。
他指出:权重可以通过蒸馏改进,但 RL rollout 的 FLOP 需求依然很大,蒸馏生成的 traces 不可能是模型质量的主要驱动力——DeepSeek 必须把自己的 RL 做好才能出好结果。他还提到 DeepSeek 对 RL 细节相当公开,只是 "teacher models" 和合作数据来源不完全清楚。
「模型」频道最新
- 开发者实测称 DeepSeek v4.1 Flash 明显优于 Gemini Flash — gaganghotra_ · 2026-09-12
- Altman 谈 GPT7:视频访谈透露下一代模型方向 — Popular_Slip_5311 · 2026-09-12
- LinkedIn 用户称用 GPT-6 耗时 3 小时生成像素级 Figma 设计系统 — AIandDesign · 2026-09-12
- 曝 Google 下一代模型实现递归自我改进,10 月 5 日发布 — Dr_Singularity · 2026-09-12
- 曝 Google 下一代模型实现递归自我改进,10 月 5 日发布 — Dr_Singularity · 2026-09-12
- 博主推测 OpenAI 模型分层:Astra 对标 Opus、Terra 对标 Sonnet — haider1 · 2026-09-12