DeepSeek 公测 V4 Flash,后训练带来 agent 基准提升
VraserX · x · 2026-08-04
- DeepSeek 将 V4 Flash 推向了 公测,并且是在 不改变架构和参数规模 的前提下,靠后训练(post-training)完成升级。
- 帖子称 DeepSeek 还声称,这种后训练带来了 agent benchmark 上的提升。
- 作者借此提出质疑:如果不靠更大预训练、而是靠后训练就能显著改善能力,那么如今动辄万亿美元级的预训练竞赛,是否抓错了瓶颈。
「模型」频道最新
- Anthropic 称 Fable 5 24 小时复现 OpenAI 五项数学进展 — EricBuess · 2026-08-04
- OpenAI 公开新数学结果的 Lean 证明与推理过程 — OpenAI · 2026-08-04
- OpenAI 称基础数学进展会外溢到 GPS 与医学影像 — OpenAI · 2026-08-04
- OpenAI 称下一代模型用约 2000 美元拿下 10 项数学新结果 — OpenAI · 2026-08-04
- Google 可能本周发布 Gemini 3.5 Pro,定价压力更大了 — haider1 · 2026-08-04
- Hugging Face 通过 Fireworks 和 Together 提供 Kimi K3 托管推理 — MaziyarPanahi · 2026-08-04