V4.1 预训练规模远超 V2.6 却差距存疑,DeepSeek 的 RL 是否真行遭质疑

teortaxesTex · x · 2026-09-23

teortaxesTex 指出,DeepSeek V4.1 Flash 与 V2.6-Flash 的预训练规模相近,而 V4.1 甚至更大,但两者表现差距可能达到一个数量级(>OOM),这引出一个问题:DeepSeek 的 RL 训练是否真的有效?他补充称,目前公开信息中关于 MOPD 阶段的细节不足,难以下结论。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →