DeepSeek 或打破 V<N> 命名惯例,新架构自称训练更稳定
stochasticchasm · x · 2026-09-11
- 推文指出 DeepSeek 似乎正在打破「V<N> = 全新预训练」的命名惯例,此前它是少数严格按此划分版本的厂商。
- 评论认为这一代像是 V4 架构的简化版,官方宣称训练过程明显更稳定;作者也对 KV cache 图表中把 DeepSeek V1 拿来对比感到好笑。
所属事件:DeepSeek 新模型技术报告:KV Cache 缩小 4 倍(3 条相关)→
「模型」频道最新
- 蚂蚁系 inclusionAI 开源 Ling-3.0-flash-VL,登顶 Hugging Face 热门 — inclusionAI · 2026-09-11
- 泄露架构疑似用全局共享 KV + 独立 SWA 换取超小 KV cache — stochasticchasm · 2026-09-11
- DeepSeek v4.1 flash 在 8 种编码框架实测:极简 harness 表现最佳 — mariofilhoml · 2026-09-11
- ChatGPT Plus 用户热议:能接受 24 小时订阅用量上限吗 — SuaveSteve · 2026-09-11
- 疑似 Qwen 新模型 n-gram 参数规模空前,前两层仅用 SWA — stochasticchasm · 2026-09-11
- 用户吐槽 Astra 上线后变笨:连 ChatGPT 桌面会话都读不了 — koltregaskes · 2026-09-11