DeepSeek 报告:后训练进步靠更好数据与环境,而非 RL 算法创新
realsohamparekh · x · 2026-09-10
DeepSeek 的报告指出,目前更好的后训练更多来自「更好的数据 + 更好的环境」,而非 RL 算法本身的新颖性。@himanshustwts 评论称这印证了数据依然是最大的护城河;@realsohamparekh 补充「还是老一套:垃圾进,垃圾出」。这一判断对做 post-training 的团队有直接参考意义:环境与数据工程质量可能比算法创新更值得投入。
「模型」频道最新
- Gemini 3.8 Flash 仅 3 轮对话自我纠错完成任务,作者晒演示 — Artistic_Solution117 · 2026-09-10
- 「外星架构」引发热议,博主建议叠加 recurrent depth 技术 — scaling01 · 2026-09-10
- 用户请愿 OpenAI 推 $400–600 重度档:$200 额度 48 小时烧光 — dragonwarrior_1 · 2026-09-10
- 爆料称 SpaceXAI 正把 Grok Bot 接入 XChat,对话中可 @ 机器人提问 — nima_owji · 2026-09-10
- 智谱新模型成绩被质疑:8 种考法报最高分,满思考档才刷出 74.2 — teortaxesTex · 2026-09-10
- 宇树全面开源 6B 人形机器人基础模型 UnifoLM-WLA-1.0 — teortaxesTex · 2026-09-10