DeepSeek 将发力持续学习,靠算法降本迭代大模型
teortaxesTex · x · 2026-07-23
推文讨论了 DeepSeek 在成本控制上的策略及其下一代模型的演进方向。
- 成本与算法优化:DeepSeek 认为通过更多算法上的创新,训练成本仍有下降空间。成本越低,他们能负担得起的模型规模就越大。
- 下一代模型目标:DeepSeek 的下一代模型必须具备持续学习(continual learning)的能力。这一目标在传闻的 V4 论文中也有所体现,并且反映在他们近期的招聘动作上。
- 当前迭代策略:在实现持续学习之前,团队目前的重心依然是不断优化模型的性价比(bang-for-the-buck)。
所属事件:DeepSeek梁文锋泄露录音:聚焦AGI与开源战略(37 条相关)→
「模型」频道最新
- OpenAI 将 GPT-5.6 向公众开放,覆盖 ChatGPT 和 API — emmanuelvivier · 2026-07-23
- 低量化 Laguna 会反复想太多,消耗上下文很快 — IUseClifford · 2026-07-23
- Qwen-Image-3.0 对上 GPT-Image-2 做复杂版式实测 — Scobleizer · 2026-07-23
- Dean Ball 认为 Kimi 编码很强,但开权重经济账仍吃亏 — koltregaskes · 2026-07-23
- Simon Willison:模型已能原生完成长任务,loops 正变得过时 — teropa · 2026-07-23
- 一个 Qwen 3.6 27B 衍生模型声称推理 token 减少 90% 以上 — AppealSame4367 · 2026-07-23