传 DeepSeek 认为 Kimi 路线难扩展,想找便宜可规模化配方
teortaxesTex · x · 2026-10-03
博主 teortaxesTex 回应网友「DeepSeek 和智谱是否在预训练上遇到大问题」时透露:DeepSeek 认为 Kimi 的路线更糟——其 2.8T 模型在当前阶段无法以足够吞吐量服务(架构对算力需求太重);智谱则在扩展上确实吃力。他表示 DeepSeek 想找的是既能规模化又保持便宜的训练配方。以上为个人转述,未获官方证实。
「模型」频道最新
- 网友称 Mnemos v3.1-jev 记忆系统准确率较 Claude 原生提升 2.5 倍 — RileyRalmuto · 2026-10-03
- Anthropic Claude 推 $250 赠金福利,周用量额度可手动重置 — Orochhe_Marou · 2026-10-03
- 网传 DeepMind 工程师帖:Google 内部模型远强于 Gemini 4 Argon — mark_k · 2026-10-03
- 用 Swift 调用 System One 模型:毫秒级确定性决策,成本远低于 LLM — rxwei · 2026-10-03
- Linux 内核 CVE 从约 500 暴涨至 1500+,报告称 LLM 是主要推手 — burny_tech · 2026-10-03
- 开发者吐槽 OpenAI 编码模型「根本停不下来」:无休止 scope creep — DavidWells · 2026-10-03