Steve Hsu:DeepSeek 效率来自架构创新,蒸馏只是次要因素

jedisct1 · x · 2026-09-12

Steve Hsu 转发回应称,非技术人士(及有意识形态倾向的技术人士)过度强调蒸馏,忽视了只有中国实验室公开发表的模型架构创新。像 DeepSeek V4.1 这样的模型效率主要来自架构本身。

他指出:权重可以通过蒸馏改进,但 RL rollout 的 FLOP 需求依然很大,蒸馏生成的 traces 不可能是模型质量的主要驱动力——DeepSeek 必须把自己的 RL 做好才能出好结果。他还提到 DeepSeek 对 RL 细节相当公开,只是 "teacher models" 和合作数据来源不完全清楚。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →