探讨 V4-0731 与 0813 版本训练差异
teortaxesTex · x · 2026-08-16
该推文讨论了两个模型版本 V4-0731 和 V4-0813 的训练策略差异。V4-0731 混合了流行代理(如 Pi/Codex)并主要担任 RL 教师;而 V4-0813 则是从 Flash 模型蒸馏而来,主要集中在最小提示词设置下,这解释了两者在推理泛化能力上的不同表现。
所属事件:DeepSeek 模型 0731 与 0813 版本泛化能力引热议(2 条相关)→
「模型」频道最新
- 知名开发者mitsuhiko发现旧模型发布 — mitsuhiko · 2026-08-16
- 拒绝盲目迷信:Qwen-3.8 27b 真的等同 Opus 4.6 吗? — HarveenChadha · 2026-08-16
- Qwen 3.8 27B的caveman思考模式仅在xhigh下生效且无工具? — Borkato · 2026-08-16
- 非主流观点:Gemini 3.1 Pro 足够日常使用 — hardmaru · 2026-08-16
- Grok 4.6 展示生成交互式未来月球城的能力 — techartist_ · 2026-08-16
- Qwen3.8-27B-AEON-PURE 跑分炸裂,全通过神级测试 — StephanSturges · 2026-08-16