DeepSeek 判定:提升数据质量的 ROI 已远超设计新后训练算法

yacineMTB · x · 2026-09-12

据 @lujasper 引述,DeepSeek 内部观点认为,当前改进数据质量的投入回报已显著高于继续研发新的后训练(post-training)算法。DeepSeek 曾发明 GRPO 并在 R1 后迭代、加入 MOPD,如今认为算法层面已足够,重心应转向数据。

所属事件:DeepSeek 称提升数据质量的回报已超新后训练算法(3 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →