V4.1 预训练规模远超 V2.6 却差距存疑,DeepSeek 的 RL 是否真行遭质疑
teortaxesTex · x · 2026-09-23
teortaxesTex 指出,DeepSeek V4.1 Flash 与 V2.6-Flash 的预训练规模相近,而 V4.1 甚至更大,但两者表现差距可能达到一个数量级(>OOM),这引出一个问题:DeepSeek 的 RL 训练是否真的有效?他补充称,目前公开信息中关于 MOPD 阶段的细节不足,难以下结论。
「模型」频道最新
- Opus 5.5 一次性生成整套幻灯片,品味惊人看呆围观者 — TAbrodi · 2026-09-23
- OpenAI 与 Anthropic 同日发模型,博主称博弈论使然 — paraschopra · 2026-09-23
- 实测 Jev 概率用词校准度:与人类语言概率图高度吻合 — burny_tech · 2026-09-23
- 博主抱怨分类器审查或扩大到几乎所有模型,不止 Fable 类 — sumitdotml · 2026-09-23
- 搜索检索到的文档在后续轮次不可见,Claude 因此产生误解 — xuenay · 2026-09-23
- 开发者实测新模型 Sol 6 擅长目标导向任务,让其通宵跑任务 — gregmushen · 2026-09-23