DeepSeek 判定:提升数据质量的 ROI 已远超设计新后训练算法
yacineMTB · x · 2026-09-12
据 @lujasper 引述,DeepSeek 内部观点认为,当前改进数据质量的投入回报已显著高于继续研发新的后训练(post-training)算法。DeepSeek 曾发明 GRPO 并在 R1 后迭代、加入 MOPD,如今认为算法层面已足够,重心应转向数据。
- 对比:ByteDance、阿里、Google、Meta 发表大量后训练算法论文,却未能跑赢自身 GPU 算力储备的应有表现。
- @lujasper 认为,这一判断对非实验室从业者早已成立:做 LLM 后训练时 80% 的精力应花在数据上。
- 具体做法:雇佣领域专家深挖 RL 任务、人工筛查 rollout 与 SFT 数据剔除可疑样本、确保任务真正可解、保证数据在难度与类别上足够多样。
所属事件:DeepSeek 称提升数据质量的回报已超新后训练算法(3 条相关)→
「Infra」频道最新
- AWS 大故障中作者靠多区切换,企业服务总停机仅 22 分钟 — generativist · 2026-09-12
- 全球数据中心耗电分布:美国占 43%,中国仅占 13% — TMWNN · 2026-09-12
- Intel 工程师实测共封装光学:V 型槽边缘耦合新方案 — jwt0625 · 2026-09-12
- Intel 工程师曝光晶圆级测试中的芯片封装检测现场 — jwt0625 · 2026-09-12
- 前 Google 工程师猜想:苹果或做 Apple Silicon 原生的下一 token 预测器 — yaroslavvb · 2026-09-12
- Yaroslav Bulatov 推 A100 专用架构实验,直指反向传播的内存墙 — yaroslavvb · 2026-09-12