观点:DeepSeek 应放弃 4.1 转向更大规模预训练
zephyr_z9 · x · 2026-08-18
作者对 DeepSeek (DS) 的战略提出建议:不应再在 4.1 版本上消耗精力,而应进行更大规模的预训练。他以 Moonshot(月之暗面)为例,称其率先预训练并发布了 3T 级别模型是明智之举,因此现在只需专注于后训练,并可在后台研发 K4 模型,目标定在 2027 年 Q1 发布。同时指出智谱和 Whale 任务繁重。被引用的推文则讨论了 Luna 和 Fable 的自验证功能,认为这暗示了 DS 在 4.1 上推动 RL 的潜力。
「公司和人」频道最新
- Sonarr 与 Radarr:开源工具如何杀死流媒体订阅 — aigleeson · 2026-08-18
- 丹麦大学招募 AI 推理机制理解方向博士后 — IAugenstein · 2026-08-18
- 面壁智能牵手厘清智能,共建具身智能端侧生态 — 面壁智能 · 2026-08-18
- Nvidia 拟支持 OpenAI 数据中心,Anthropic 营收惊人 — Stratechery · 2026-08-18
- 哥本哈根大学 Pepa Atanasova 获丹麦研究人才奖,表彰可信AI研究 — IAugenstein · 2026-08-18
- LLM API 账单结构调研:Token 与费用 CSV 如何对账? — Neat-Ad-4224 · 2026-08-18