DeepSeek 转向:提升数据质量的 ROI 已超过新算法
A_K_Nain · x · 2026-09-11
一条值得注意的信号:一向最先探索新算法与架构的 DeepSeek 表示,当前提升数据质量的 ROI 已远超继续研究新 post-training 算法。
引述者认为这对非实验室从业者早已成立,并给出建议:做 LLM post-training 时 80% 的精力应花在数据上——
- 请专家逐条检查 RL 任务
- 人工筛查 rollouts 和 SFT 数据,剔除可疑样本,确认所有任务真的可解
- 保证数据在难度和类别上足够多样
所属事件:DeepSeek:数据质量提升的回报已超新算法创新(2 条相关)→
「模型」频道最新
- DeepSeek V4.1 Flash 上线 HuggingChat,首批用户体验称表现出色 — _akhaliq · 2026-09-11
- DeepSeek 或打破 V<N> 命名惯例,新架构自称训练更稳定 — stochasticchasm · 2026-09-11
- DeepSeek 新模型技术报告:KV Cache 较 DSV4-Flash 缩小 4 倍,训练更稳定 — stochasticchasm · 2026-09-11
- 博主首测 Meta AI Muse:感知细腻有个性,劝人别忽视 — thederbiedone · 2026-09-11
- 开源 CyberTiel 35B 去审查后反而更强:速度达 Qwen3.8 的 3.7 倍 — peculiar-ragdoll · 2026-09-11
- GLM-5.3 霸榜 CyberGym:前两名 agent 均采用,前六占四席 — pcuenq · 2026-09-11