DeepSeek V4.1 Flash 内核工程大幅进步,GLM-5.3 Flash 相去甚远
teortaxesTex · x · 2026-09-12
推主 teortaxesTex 称 DeepSeek V4.1 Flash 在内核工程(kernel engineering)能力上有「巨大提升」,GLM-5.3 Flash 远不及。引用的实测贴显示:V4.1 Flash 在 KernelBench-CUDA 上为 RTX PRO 6000 写出 DeepSeek 原生稀疏注意力内核,达 dense 等效 roofline 的 0.50,排第四(Fable 5.1 为 1.06、Opus 5 为 1.04);内核使用内联 PTX(mma.sync bf16、ldmatrix、xor-swizzled cp.async)并把 fp32 block-scoring top-8 前导融合进注意力内核。作者指出其在 8K 上下文语义只需约 14% 的因果块三角,却执行了 78%,这部分冗余计算正是与前三名的差距所在。
所属事件:DeepSeek 4.1 Flash 实测:缓存降价 7 倍,内核大升级(2 条相关)→
「模型」频道最新
- 深度学习大佬谈「开源」真义:开放权重是没有图纸的房子 — YiMaTweets · 2026-09-12
- MolmoAct2 已在 VLA-Replica 上微调,将迎战 OpenAI VLA — YuXiang_IRVL · 2026-09-12
- Anthropic 服务条款禁止用模型做 AI 开发,引发争议 — teortaxesTex · 2026-09-12
- Steve Hsu:DeepSeek 效率来自架构创新,蒸馏只是次要因素 — jedisct1 · 2026-09-12
- $200 Max 套餐一周额度告罄两次,Astra 重度用户叫苦 — gregmushen · 2026-09-12
- 用户语音Agent首次反驳自己:GPT语音版会正面顶嘴了 — evielync · 2026-09-12