DeepSeek V3→V4 空窗之谜:网友归因架构探索失败,并否定 Ascend 训练传闻
teortaxesTex · x · 2026-09-25
关于 DeepSeek V3 与 V4 之间的发布间隔,teortaxesTex 提出解释:一系列架构探索未能在规模上奏效(从 NSA 稀疏注意力开始),推测他们可能在 Ascend 上做过实验并因此转向 TileLang。
同时他直接否定 Epoch AI 相关传闻:所谓 R2 或「在 Ascend 上训练主力产品模型」的传言只是「坏了的电话游戏」,毫无事实依据——除了暴露 Epoch 的证据标准问题,不影响其更宏观的分析。
「模型」频道最新
- 大学生吐槽:$30/月的 Gemini Pro 幻觉频发令人失望 — makeitbumthem · 2026-09-25
- Meta AI 应用前 12 天北美下载 180 万,超同期 ChatGPT — Beth_Kindig · 2026-09-25
- Opus 5.5 用量更合理:20x 套餐最长会话跑满 13 小时 — majidmanzarpour · 2026-09-25
- 分类模型 Jev 号称快 200 倍便宜 400 倍,或重塑 AI 应用架构 — rseroter · 2026-09-25
- Prime Intellect 推理服务上线,号称 GLM 5.3 最高吞吐 — willcb · 2026-09-25
- 开发者拆解 Claude Code:思考提示语只是按 15 秒定时器轮换 — ryunuck · 2026-09-25