DeepSeek V4.1 架构再进化:HBM 需求降至 1/3.9,跑分全面刷新

teortaxesTex · x · 2026-09-10

爆料称 DeepSeek V4.1 采用全新 Causal-Encoder-Decoder 架构,总参数 552B(激活 8B/输出 16B),官方基准表现亮眼:TerminalBench 4.0 达 31.2,CyberGym 88.1,ExploitGym 15.3,HLE 带工具 63.9,Automation-Bench 54.8。

效率方面更惊人:相比 V4-Flash,HBM 需求再降 3.9 倍,SSD 需求降 8 倍。作者指出半年过去仍无其他模型逼近 V4 架构的 KV cache 效率,并推测其推理成本下毛利超过 90%。

作者感叹:如果这是一家美国实验室,讨论话题早就该是「递归自我改进」了。注意:为非官方账号发布的基准数据,真实性待验证。

所属事件:DeepSeek V4.1/Flash 曝 552B 新架构跑分(12 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →