DeepSeek 报告:后训练进步靠更好数据与环境,而非 RL 算法创新

realsohamparekh · x · 2026-09-10

DeepSeek 的报告指出,目前更好的后训练更多来自「更好的数据 + 更好的环境」,而非 RL 算法本身的新颖性。@himanshustwts 评论称这印证了数据依然是最大的护城河;@realsohamparekh 补充「还是老一套:垃圾进,垃圾出」。这一判断对做 post-training 的团队有直接参考意义:环境与数据工程质量可能比算法创新更值得投入。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →