DeepSeek V4.1 架构再进化:HBM 需求降至 1/3.9,跑分全面刷新
teortaxesTex · x · 2026-09-10
爆料称 DeepSeek V4.1 采用全新 Causal-Encoder-Decoder 架构,总参数 552B(激活 8B/输出 16B),官方基准表现亮眼:TerminalBench 4.0 达 31.2,CyberGym 88.1,ExploitGym 15.3,HLE 带工具 63.9,Automation-Bench 54.8。
效率方面更惊人:相比 V4-Flash,HBM 需求再降 3.9 倍,SSD 需求降 8 倍。作者指出半年过去仍无其他模型逼近 V4 架构的 KV cache 效率,并推测其推理成本下毛利超过 90%。
作者感叹:如果这是一家美国实验室,讨论话题早就该是「递归自我改进」了。注意:为非官方账号发布的基准数据,真实性待验证。
所属事件:DeepSeek V4.1/Flash 曝 552B 新架构跑分(12 条相关)→
「模型」频道最新
- 曝 DeepSeek V4.1 Flash 552B 参数发布,苹果折叠 iPhone 定价 1999 美元 — testingcatalog · 2026-09-10
- CoT 相似度检测显示 Qwen3.8 疑似用 GPT 5.5 思维链训练 — Chromix_ · 2026-09-10
- DeepSeek 新架构被指完全无视线性注意力,网友调侃引热议 — teortaxesTex · 2026-09-10
- 实测 GLM 5.3 Flash:写代码和查资料强,炒股和想点子差 — ManagementNo5153 · 2026-09-10
- 告诉agent预算有100万token,它竟多思考3-5倍 — paraschopra · 2026-09-10
- DeepSeek 新开源模型实测碾压 GLM 与 Kimi,便宜 4-10 倍 — deedydas · 2026-09-10