DeepSeek V4.1-Flash 引热议:552B 参数对标 GPT-5.6
teortaxesTex · x · 2026-09-10
DeepSeek 发布 V4.1-Flash,基准表现据称达到 GPT-5.6 Sol 水平而参数仅 552B,引发「benchmarkmaxxed」质疑。架构亮点是激进的 KV cache 压缩:采用 Causal Encoder-Decoder(CED)架构,decoder 全局 KV 由 encoder 末层隐状态投影而来,prefill 每 token 仅激活 8B 参数、decode 激活 16B,对输入密集的 agentic 场景成本友好。giffmana 注意到其原生多模态仍用 SigLIP,推测是求稳之选。
所属事件:DeepSeek V4.1 及 Flash 疑似参数跑分曝光,挑战 GPT-5.6 Sol(19 条相关)→
「模型」频道最新
- DeepSeek V4.1-Flash 发布:552B MoE 仅激活 8-16B,内存省 3/4 — mark_k · 2026-09-11
- Grok Voice Think Fast 2.0 High 居语音对话模型榜首,难被超越 — XFreeze · 2026-09-11
- 博主吐槽基准图表"造假":DeepSeek V4.1 得分竟低于 DeepSWE — teortaxesTex · 2026-09-11
- 「真实 API 计价法」颠覆性价比认知:GPT-5.6 Luna 低至 $0.00083/MTok — teortaxesTex · 2026-09-11
- ThursdAI 周报:Astra、Navier Stokes 与 Muse 助手 — thursdai_pod · 2026-09-10
- 实测称 DeepSeek v4.1-flash 子智能体编排能力大幅改善 — adonis_singh · 2026-09-10