DeepSeek V4.1-Flash 引热议:552B 参数对标 GPT-5.6

teortaxesTex · x · 2026-09-10

DeepSeek 发布 V4.1-Flash,基准表现据称达到 GPT-5.6 Sol 水平而参数仅 552B,引发「benchmarkmaxxed」质疑。架构亮点是激进的 KV cache 压缩:采用 Causal Encoder-Decoder(CED)架构,decoder 全局 KV 由 encoder 末层隐状态投影而来,prefill 每 token 仅激活 8B 参数、decode 激活 16B,对输入密集的 agentic 场景成本友好。giffmana 注意到其原生多模态仍用 SigLIP,推测是求稳之选。

所属事件:DeepSeek V4.1 及 Flash 疑似参数跑分曝光,挑战 GPT-5.6 Sol(19 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →