探讨 V4-0731 与 0813 版本训练差异

teortaxesTex · x · 2026-08-16

该推文讨论了两个模型版本 V4-0731 和 V4-0813 的训练策略差异。V4-0731 混合了流行代理(如 Pi/Codex)并主要担任 RL 教师;而 V4-0813 则是从 Flash 模型蒸馏而来,主要集中在最小提示词设置下,这解释了两者在推理泛化能力上的不同表现。

所属事件:DeepSeek 模型 0731 与 0813 版本泛化能力引热议(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →