DeepSeek V4.1 Flash 后训练全靠数据:合成多智能体轨迹加 checkpoint 合并
nrehiew_ · x · 2026-09-11
nrehiew 解读 DeepSeek V4.1 Flash 技术报告的后训练部分:
- 数据驱动:agent 轨迹首次明确由真实合作伙伴使用模式启发,通过系统中多个 agent 合成生成数据
- checkpoint 合并:将不同 scaffold 和配置的训练 run 合并 checkpoint,带来「免费」的性能提升
- 后训练哲学:如今完全以数据为中心,而非训练算法研究
结论:DeepSeek 的路线已从算法创新转向对数据配方和工程细节的极致打磨。
所属事件:DeepSeek V4.1 技术报告解读:RL 基建、沙箱与推理栈细节曝光(8 条相关)→
「模型」频道最新
- ApprenticeBench 揭真实工作差距:闭源 72% vs 开源 Kimi K3 仅 18% — ysu_nlp · 2026-09-11
- CursorBench 4.0 上线:Muse Spark 1.3 性能追平 Sol,价格不到四成 — jyangballin · 2026-09-11
- 稀疏注意力可做多层级:DeepSeek V3.2 思路与搜索排序系统同构 — nptacek · 2026-09-11
- muse spark 1.3 在 CursorBench 4 上表现强且便宜 — infoxiao · 2026-09-11
- 用户盼 Haiku 3.5 回归:旧模型可被永久切断引不满 — repligate · 2026-09-11
- kalomaze:fable 5 部分问题出在后训练没做熟 — kalomaze · 2026-09-11