专题 · FULL STORY

DeepSeek V4.1 Flash:从内测到开源实测

DeepSeek V4.1 Flash 于 9 月 8 日以中间版本开启限时内测,9 月 10 日正式发布并开源,三端同步上线并降价。实测显示其性能逼近前沿模型,KV Cache 缩小 4 倍,登顶 Vals 开源榜,引发架构与安全热议。

2026-09-08 ~ 2026-09-11 · 15 集 · 154 条

第 1 集 · DeepSeek V4.1 Flash 限时内测:新架构原生多模态(2026-09-08,18 条)

9 月 8 日,多个消息源先后披露 DeepSeek V4.1 Flash 已以「中间版本」形式开启限时内测,模型 ID 为 deepseek-v4.1-flash-expires-on-0910,slug 中的日期表明该内测于 9 月 10 日过期。核心升级点是全新模型架构与原生多模态支持,官方口径称能力更强、速度更快、成本更低。调用方式、计费与并发规则已基本明确,开发者实测陆续出现,模型还悄然现身 Hugging Face,但正式公开公告与完整能力评测仍待官方发布。

已确认

  • 机器之心报道称 DeepSeek 官方宣布 V4.1 Flash 中间版本开始内部测试,主要升级为全新模型架构、原生多模态、能力更强速度更快成本更低;APPSO、智东西、aigclink、赛博禅心等也确认了同一消息。
  • 调用方式:保持 baseurl 不变,将模型名设为以 deepseek-v4.1-flash-expires-on-09 开头的 ID(如 deepseek-v4.1-flash-expires-on-0910)。APPSO、tokenbender、kimmonismus 等指出该日期即过期时间。
  • 据 vista8 转述的官方微信群通知,计费与 V4 Flash 相同,单账号最多 20 并发;teortaxesTex 提到的泄露信息同样指向并发仅 20,并称该中间版本带有视觉能力(V4-Flash-Vision [Intermediate])。
  • 价格方面,MiaAIlab 经 MicahBerkley 转述称该版本价格极为激进,约 1 美元可消耗 5800 万 token,且限时约 2 天可用。
  • 第三方账号 LuminaBench 发现 DeepSeek 正在 API 上测试该中间构建版本,tokenbender 认为这或为正式版前哨。
  • 实测表现:9 月 10 日 Kevin Kern 试用了预览端点,推理速度约 300 tok/s,并在其任务中大量并行调用子代理;他同时指出预览端点暂不支持视觉输入,期待正式版补齐多模态。智东西的报道则提到输出最快可达 507 tokens/s。
  • 9 月 10 日,Reddit 用户发现 Hugging Face 上出现 deepseek-ai/DeepSeek-V4.1-Flash 模型页面,疑似官方已悄然上传;具体规格与能力信息尚不明确,未经官方公告证实。

尚未确认

  • 消息最初由 op7418、AGI Hunt 等博主从 DeepSeek 官方微信群传出,当时均强调未经官方公开发布公告证实;后被机器之心以「官方宣布」口径报道,但正式公开公告与完整能力细节仍待官方发布。
  • 网友 @NFTChen(经 solyarisoftware 转发)爆料称 V4.1 Flash 预计北京时间 9 月 10 日前后正式发布,且 V4 Pro 请求将按 Flash 价格路由;该说法未经 DeepSeek 官方一手确认。
  • 预览端点不支持视觉输入与「原生多模态」的官方说法之间存在张力,正式版是否补齐视觉能力尚待验证(Kevin Kern 亦仅表达期待)。
  • teortaxesTex 转引 @xhyctf 及网友调侃称希望其至少在视觉之外能打赢 GLM 5.3 Flash,仅为社区观点,无评测依据。

为什么重要

  • 这是 DeepSeek 首次被曝以「中间版本(expires-on)」形式放出限时内测,且计费与并发规则同步明确,配合激进定价,显示其在正式发布前通过开发者实测快速迭代、并借限时窗口收集大规模真实负载的产品节奏。
  • 原生多模态意味着 DeepSeek 主力模型路线的重大升级;实测已给出约 300 tok/s 的速度参考,且模型已现身 Hugging Face,社区正将其与 GLM 5.3 Flash 等竞品对标,正式版发布后的多模态与能力实测值得持续关注。

第 2 集 · DeepSeek V4.1 Flash实测:极速350 tokens/s但偏实验性(2026-09-08,2 条)

多位开发者和博主对DeepSeek实验性模型V4.1-Flash进行实测:YouTuber WorldofAI和开发者ivanfioravanti均报告解码速度约300-400+ tokens/秒,价格也具竞争力,速度表现令人印象深刻。但该模型仍处实验早期,且被指有「爱过度思考」的倾向,整体更适合作为极速、低成本的预览选项而非生产级选择。

第 3 集 · DeepSeek V4-Flash 降价并改峰谷计费,9 月 10 日生效(2026-09-08,6 条)

DeepSeek 宣布自北京时间 9 月 10 日 12:00 起下调 V4-Flash(flash)系列 API 定价,输入价格回到此前涨价前水平,并改为峰谷分时计费,错峰时段降幅最大。此前一天社区渠道已泄露价格表,随后官方公告确认。新方案将接替此前生效的 "Intermediate" V4.1 定价。

已确认

  • DeepSeek 开放平台公告:9 月 10 日 12:00 起 V4-Flash 系列降价(机器之心、量子位、aigclink 转述官方公告)。
  • 闲时定价(元/百万 token):缓存命中输入 0.02 元(由 0.05 元下调,降 60%);缓存未命中输入 1 元(由 1.5 元下调,降 33.33%);输出 4 元(由 4.5 元下调,降 11.11%)。
  • 高峰时段为工作日 9:00–12:00、14:00–18:00,其余为闲时;高峰时段价格高于闲时,具体数值以官方价目为准。
  • 此前生效的 "Intermediate" V4.1 定价方案到期后由新方案接替(teortaxesTex 汇总)。
  • 第三方渠道价格更低:michaelsoftbinbows 指出 OpenRouter 上经 openinference 接入的 DeepSeek V4 Flash(0731)非峰时价格仅输入 $0.05 / 输出 $0.16 每 1M tokens,低于官方定价($0.22 起),引发热议。

尚未确认

  • 公众号「赛博禅心」提及新方案伴随 20 并发限制,标注待官方最终确认,官方公告未见明确说明。

时间线

  • 09-08:teortaxesTex 汇总泄露的新价格体系;「赛博禅心」同日发布降价消息,含 2026 年 9 月 10 日 12:00 生效时间与并发限制细节,待官方确认。
  • 09-09:量子位、机器之心、aigclink 等报道,DeepSeek 官方公告确认降价;同日 OpenRouter 第三方低价引发讨论。
  • 09-10 12:00:新价格正式生效。

为什么重要

  • 输入价格回到涨价前水平,意味着此前涨价被部分回撤,对依赖 DeepSeek API 的开发者与厂商成本直接利好。
  • 错峰缓存命中低至 0.02 元/百万 token,叠加峰谷分时计费,将引导用户错峰调用、提高缓存利用率,也反映 DeepSeek 供给能力与调度策略的变化。
  • 官方与第三方渠道(如 OpenRouter)价差显著,为开发者提供了更低成本的替代接入途径。

第 4 集 · DeepSeek V4.1 Flash 多场景实测:近前沿性能、超低成本(2026-09-09,15 条)

DeepSeek V4.1 Flash 及同日开放的 V4.1 Flash Vision Beta 在发布后数日内接受多轮独立实测,普遍结论是性能逼近甚至部分追平前沿闭源模型,而成本仅为对方的约百分之一到三十分之一;Artificial Analysis 的量化评测(智能指数 40,113 个模型中排第 6)也从榜单维度印证了这一位置。设计、安全、代码、知识工作、视觉、终端代理与本地部署等多个场景的测试相互印证了这一性价比。

已确认

  • 权威榜单:Artificial Analysis 公布 V4.1 Flash(推理版,Max Effort)评测结果:智能指数 40,在 113 个模型中排第 6,吞吐约 190 tokens/秒;该模型为开放权重,2026 年 9 月发布。
  • 设计类横评:博主 NFTChen 在日常设计任务横评中测得 DeepSeek V4.1 Flash 得 81.2 分,达到 GPT-6 Astra(82.7 分)的 98%,超过 Claude Fable 5.1 的 80.3 分,成本约为 Astra 的 1.4%;uxl 转述的 OpenDesign Arena 榜单数据显示类似性价比,ChrisUniverse 转述的 OpenDesignHQ 评测还指出除 Astra 外其他模型分数更低且成本更高(真伪未获官方证实)。
  • 网络安全基准:pilvar222 团队测试 V4.1 Flash 单次运行可重新发现基准中 65.6% 的近期 CVE(旧版 55.2%),pass@3 下捕获率达 84.4%(旧版 75%),追平前沿模型。
  • 代码修 bug 实测:Pawel Huryn 用 2 个仓库、105 个隐藏真实 bug 测试,V4.1 Flash 成绩进入 Pareto 前沿——作为参照,Opus 5 (max) 找到 27 个、成本 $51.33,Grok 4.6 (max) 同为 27 个、成本 $16.96,而 V4.1 Flash 成本约为 Opus 的 3.5%(约 1/28 价格);作者还补充 FAQ 回应常见质疑。该结果被 sander、soveLight 等多个账号独立转述,sander 转述版本给出 V4.1 Flash 得 24 分。
  • 知识工作实测:博主 himanshustwts 团队用同一批 22 个内部任务(覆盖工程、业务运营、金融、医疗)横向评测 11 个前沿模型,V4.1 Flash 在 KnowledgeWork 评测中拿到 15/21 通过、接近 SOTA,成本仅为竞品的约 2%;任务平均含 120+ 验证器、以 GPT-5.5 为裁判,整套跑完成本仅 $0.34。
  • 视觉能力:Reddit 用户 cheezeerd 在发布当天对 V4.1 Flash Vision Beta 与 V4 Flash Vision 做 5 项视觉任务对比,并附完整视频走查首稿与三轮修订结果,结论是新版本输出质量明显更好、更可靠,且 API 定价更低。
  • 代码代理表现与定价:dejavucoder 转述 Cline 官方引用的消息称,V4.1-Flash 发布不到一个月即在 Terminal-Bench 上超越 V4-Pro 0813 版本;定价为每百万 token 输入 0.30 美元起,约为 Opus 的 1/20。
  • 本地部署:TheZachMueller 转述的开发者实测显示,DeepSeek 4.1 Flash 以全精度配合 DSpark 引擎,在 4 颗 Apple Max-Q 芯片、仅 64GB 系统内存的机器上跑出约 200 TPS,关键技巧是对约 200GB Engram 的处理。

尚未确认

  • 除 Artificial Analysis 榜单外,各项成绩均来自第三方个人或团队测试,样本与评测方法各异;OpenDesignHQ 评测真伪未获官方证实;Terminal-Bench 超越 V4-Pro 一说源自 Cline 官方引用的消息;Mac 本地 200 TPS 数据为单一开发者实测,官方指标和大规模复现结果均尚未见。

为什么重要

  • 多个独立来源、不同任务类型的测试相互印证 V4.1 Flash 的性价比,而非单一榜单的孤证;Artificial Analysis 的排名进一步提供了中立第三方的量化背书。
  • 若结果可复现,超低价近前沿模型将进一步压缩闭源旗舰模型的定价空间,并降低开发者与企业的迁移门槛。
  • 能在消费级 Apple 硬件上全精度高速运行,意味着该模型还具备本地化、私有部署的吸引力,扩展了应用场景。

第 5 集 · DeepSeek 发布 V4.1-Flash:552B MoE 低价反超旗舰(2026-09-09,56 条)

DeepSeek 于 9 月 10 日正式发布并开源新模型 V4.1 Flash,在网页、App 与 API 三端同步上线,API 模型名为 deepseek-flash,权重以 MIT 协议上架 Hugging Face(提供 fp8/8-bit 版本,支持 transformers 部署)。官方称其性能、费用、速度全面超越自家旗舰 V4 Pro,价格大幅下降,是近期最受关注的开源模型发布之一。

已确认

  • 架构与规模:552B 总参数的非对称 MoE,采用全新 Causal Encoder-Decoder 架构,输入侧仅激活 8B 参数、输出侧激活 16B,支持最高 100 万 token 上下文,借助跨层共享的压缩 KV Cache 等技术节省 7/8 的 KV 缓存开销(@YuchenjUW 称 KV cache 每 token 体积再降 4 倍),并采用两阶段稀疏索引器等设计。官方称非对称激活与 KV 缓存节省是跑赢旗舰的关键。
  • 多模态与生态:这是 DeepSeek 新架构家族中首个原生支持视觉理解(image-text-to-text)的模型,也是该家族目前最小的成员,可为更大规模模型铺路;vLLM 与 SGLang(含 RL 框架 Miles)均提供零日支持,LMSYS 团队发布技术博客拆解新架构,并已在 NVIDIA/AMD GPU 上验证。官方公开征集 2000 GPU + 存储集群级别的大规模部署合作,并附论文。
  • 定价与基准:官方公布新定价,谷峰价差 50%;社区转述输入价格约 $0.14-0.15/M、输出约 $0.60/M;@kimmonismus 称输出价格仅为 GPT-5.6 Sol 的 6%,@YuchenjUW 称整体成本约为其 3%。据 Artificial Analysis 数据,V4.1 Flash 在其 Intelligence Index 得分 40,反超自家 1.6T 参数的 Pro 旗舰,而 token 价格便宜约 4 倍;社区帖称 DeepSWE v1.1 得分 74.2%、CyberGym 88.1 vs 84.5,API 成本约为 Opus 5 的 2.5%。
  • V4 Pro 退役与路由:官方公告称,在 V4.1 Pro 上线前,所有 V4 Pro 请求将被自动路由到 V4.1 Flash 并按更低价格计费;据 @markk 转述,9 月 14 日起 V4 Pro 请求即切换。旧模型 V4-Flash 与 V4-Flash-Vision-E 等也将退役。V4.1 Flash 距 7 月的 V4-Flash 发布仅约六周,迭代节奏明显加快。
  • 行业反应:Hugging Face 联合创始人 Thom Wolf 称该模型重回开源排行榜榜首且价格极低,并制作前向传播可视化视频展示其推理设计;多位研究者将其视为近期最重要的模型发布之一。Redis 作者 antirez 则持保留态度,认为相比上一代 4.0 Flash 并非质的飞跃——backbone 参数翻倍仅带来小幅领先。

尚未确认

  • 部分转发帖(@solyarisoftware)出现 769B 总参数的说法,与官方口径的 552B 不一致,以官方 552B 为准。@ns123abc 称每百万 token 成本约为竞品的 1/86、输出速度 420-507 tok/s(快于 Gemini),该说法源自网络爆料,数字待独立验证。

为什么重要

  • 以极低的激活参数量和成本达到超越旗舰 V4 Pro 的表现,配合 MIT 开源,可能进一步压低行业推理价格并冲击闭源厂商;但如 antirez 所指出的,相对前代的代际提升幅度存在争议。
  • V4 Pro 用户需注意 9 月 14 日前后自动路由带来的行为变化,依赖其能力的开发者应在切换前评估实际表现。
  • 百万 token 上下文、原生视觉与 7/8 的 KV 缓存节省,对长文档与智能体工作流场景的可用性和成本有直接影响;该模型还为同架构家族更大规模模型铺路。

还有 36 条相关讨论 →

第 6 集 · DeepSeek V4.1 Flash 爆料:552B 非对称架构对标 GPT-5.6(2026-09-10,20 条)

9 月 10 日,多位博主集中曝光了据称是 DeepSeek V4.1 及 V4.1 Flash 的官方基准成绩与技术细节,Sentdex 于次日称权重已放出。若属实,V4.1 将以 552B 非对称激活架构在多项 agentic/编码基准上正面挑战 GPT-5.6 Sol,并凭极致 KV 压缩大幅压低推理显存与成本,还带来 1-100 连续可调推理力度等罕见设计。官方尚未确认任何信息,iScienceLuvr 等博主公开质疑成绩可能存在刷榜成分。

已确认

  • 信息均为未经官方证实的爆料,主要来自 teortaxesTex、eliebakouch、ChrisGPT、nrehiew、iScienceLuvr、AdinaYakup、zainhas、Sentdex 及 @sheriyuo(经 AndrewZhao 转发)、@MiaAIlab(经 airesearch12 转发)等博主,各帖数据相互印证;另有 SemiAnalysis 发帖「祝贺」发布(经 bodonoghue85 转发)。
  • 模型总参数 552B,采用全新 Causal-Encoder-Decoder 架构,输入激活 8B、输出激活 16B;nrehiew 补充称同一模型在预填充与解码两个阶段激活不同数量的参数(解码 8B、预填充 16B),属此前少见的设计。多个来源强调其成本显著低于同尺寸模型,sheriyuo 称其「智能超自家旗舰」;MiaAIlab 称其能力大致持平或优于 GPT-5.6 Sol、Claude Opus 5、GLM 5.3 和 Kimi K3 等一线模型;Sentdex 援引的原推称权重已放出,模型比前代大不少,并在多个关键领域超过 Opus-5、GPT-5.6-Sol、Kimi-K3 和 GLM-5.3。
  • 曝光跑分:TerminalBench 4.0 得 31.2,CyberGym 88.1(对比 GPT-5.6 Sol 的 84.5),HLE 63.9;ChrisGPT 称多项 agentic/编码基准超越 GPT-5.6 Sol;nrehiew 称 V4.1 Flash 在 DeepSWE 以 74.2 分登顶,超过 Opus 5 与 Gemini 3.8 Flash。
  • eliebakouch 引述的技术报告显示 V4.1 Flash 为原生视觉模型,训练于 45T tokens,架构被赞为近年最新颖;AdinaYakup 称其原生视觉能力合并到同一端点。
  • zainhas 连发三帖指出,V4.1 Flash 支持 reasoningeffort 从 1 到 100 连续可调,而非业界常见的 low/medium/high 离散档位,并罕见提供 API 兼容映射;其称此前未见过任何模型采用这种设计,其中一帖附上了据称是该模型的论文链接。

架构与工程亮点

  • 据 teortaxesTex 爆料,KV cache 压缩至 890 字节/token,百万 token 不足 1GB;相比 V4-Flash,HBM 需求再降 3.9 倍,SSD 需求降 8 倍,且发布半年后仍未被超越。AdinaYakup 称 KV 缓存缩至首代的 1/437,HBM 占用为上一代 1/4、SSD 为 1/8。
  • Scobleizer 转发的信息补充定价:$0.15 输入 / $0.60 输出每百万 token,AdinaYakup 称价格仅为 Opus 的四十分之一。
  • 同据 teortaxesTex(经 zephyrz9 转发),V4.1 砍掉 V4 的临时补丁:放弃 HCA、将 CSA 泛化为更通用原语、去掉稀疏注意力的 warmup 阶段、采用更简单的单遍 mHC;另提及新的稀疏注意力设计(经 donglixp 转述)。

尚未确认

  • 所有跑分、参数规格、定价、架构细节及权重放出的说法均无官方来源,最终发布版本可能存在差异;iScienceLuvr 明确表示对「GPT-5.6 Sol 级别」的成绩持怀疑态度,怀疑存在刷榜成分,相关帖中也出现「benchmarkmaxxed」的质疑。

为什么重要

  • 若爆料属实,V4.1 在 agentic/编码能力上正面挑战 GPT-5.6 Sol,同时凭借不对称激活与极致 KV 压缩大幅降低部署显存门槛;1-100 连续推理力度若属实,也将为 API 侧的推理成本与深度调控提供新的交互范式,在开源开放生态下对推理成本影响显著。

第 7 集 · DeepSeek V4.1 Flash 评测跑分流出,社区热议实测表现(2026-09-10,2 条)

DeepSeek V4.1 Flash 发布后,Reddit 等社区流传出该模型的首批评测成绩截图,成为与其他前沿模型对比的依据之一。网友转发的截图显示,该模型在 deepswe 榜单上达到 SOTA,与 sol 和 fable5 同列,并在 terminal bench 上表现出较强竞争力,整体跑分亮眼,引发社区热议。

第 8 集 · Bug Hunt Bench 实测 105 个真实 Bug,DeepSeek V4.1 Flash 高性价比夺目(2026-09-10,8 条)

Pawel Huryn(The Product Compass 作者)发布并运营 Bug Hunt Bench 基准:在两个生产代码库中人为埋入 105 个真实 bug,让 GPT-6、Claude、Grok、Gemini、DeepSeek、Kimi、GLM 等前沿模型在各自 agentic 配置下修复,按修复数量盲评排名,每个仓库只给一次提示,满分 105,结果持续更新于其 GitHub 榜单页面。

已确认

  • GPT-6 Astra 补测成绩:low 档 27/105、medium 档 34/105,结果此前已于 9 月 4-5 日发布,可在榜单页面用过滤器对比查看。
  • DeepSeek-V4.1-Flash(high 档):max effort 下修复 24/105,总花费仅 $1.80,耗时 42.6 分钟。
  • Huryn 复测发现 V4.1 Flash 明显优于 V4 Pro:DeepSeek V4 Pro(max)仅 16/105,花费 $1.89、耗时 37 分钟,即 Flash 得分更高还更便宜。

为什么重要

  • 该基准用真实仓库预埋 bug、盲评、单次提示的设定,比传统合成基准更贴近实际修 bug 场景。
  • Huryn 强调 DeepSeek-V4.1-Flash 以约 $1.80 的成本修复 24 个 bug,在同级价格中性价比突出,且反超自家更贵的 V4 Pro,为预算敏感的团队提供了有参考价值的选型数据。

第 9 集 · DeepSeek V4.1 Flash 架构解析:YOCO 灵魂与 KV 缓存复用(2026-09-10,7 条)

9 月 10 日,多位博主集中讨论 DeepSeek 新模型 V4.1 的架构变化:DeepSeek 被指回归编码器-解码器架构,并在架构层面做出多项创新且全面开源,被认为持续拉高了 AI 研究生态的技术下限。当前这些信息多来自论文细节与 KOL 分析,官方口径尚不统一,架构定名仍存争议。

已确认

  • DeepSeek 将新架构相关技术信息公开开源。
  • Astra Pro 深读 V4.1 论文发现,DeepSeek 在不同 checkpoint 之间复用 KV 缓存,被评论者称为「奇怪的模型工厂」。
  • DeepSeek 引用 2024 年的 YoCo(You Only Cache Once)论文作为其 Causal-Encoder Decoder(CED)transformer 模块的主要灵感来源。

尚未确认

  • 据 KOL MaxForAI 对 V4.1 Flash 论文结构图的分析(未经官方确认),模型至少有三大架构变化:回走编解码结构、引入 CSA2 跨层复用等,真正值得关注的是对 Transformer 本体的改动而非参数或跑分。
  • 开发者 aHapBean 认为「Causal Encoder-Decoder」名不副实:V4.1 可能仍是 decoder-only LLM,该命名夸大了架构革新,更准确的说法应参考 YoCo 的思路。

为什么重要

  • @evijit 指出,DeepSeek 连续在架构级而非仅规模层面创新并开源,抬升了整个开源社区的技术下限。
  • KV 缓存在 checkpoint 间复用等做法若属实,可显著降低训练与部署成本,对推理经济性有直接影响。

第 10 集 · DeepSeek V4.1 Flash 架构解析:非对称设计与省成本机制(2026-09-11,2 条)

DeepSeek 最新技术报告披露 DeepSeek-V4.1-Flash 全新架构。多位技术博主逐层拆解发现:该模型采用非对称因果编码器-解码器结构与 CSA2 注意力机制,拥有百万 token 上下文窗口,但也带来「为保留上下文付费」的第二重成本。整体设计同时压低计算与内存开销,在长上下文场景下兼顾性能与成本。

第 11 集 · DeepSeek 新模型技术报告:KV Cache 缩小 4 倍(2026-09-11,3 条)

技术博主在阅读 DeepSeek 新模型(V4.1 Flash)技术报告时指出多个亮点:基准成绩高得惊人;相比 DSV4-Flash,KV Cache 缩小了 4 倍,这对推理显存占用与长上下文成本影响很大;此外训练过程也更加稳定。这些改进被认为对实际部署成本与效率有重要意义。

第 12 集 · DeepSeek V4.1 Flash 登顶 Vals 开源榜,成本仅 0.3 美元(2026-09-11,2 条)

据 ValsAI 测评,DeepSeek V4.1 Flash 登顶 Vals Index 开源权重模型榜,超越 Kimi K3。每次测试成本仅 0.3 美元,是开源前十中最便宜的方案。有网友指出其价格约为 Kimi K3 与 GLM 5.3 的二十分之一,以极低成本登榜引发关注。

第 13 集 · DeepSeek V4.1 Flash 评测得 40 分,幻觉率上升仍领先开源(2026-09-11,2 条)

Artificial Analysis 公布 DeepSeek V4.1 Flash 评测结果:AA 指数得 40 分,虽仍低于 GLM-5.3-Flash,但已超过最新的 DeepSeek V4 Pro。细分上,AA-Omniscience 提升 9 分至 -5.3,准确率从 40% 有所上升,不过幻觉率也有所上升,整体仍领先开源同侪。

第 14 集 · DeepSeek CED 与 GLM 的 KV 缓存复用机制解析(2026-09-11,4 条)

社区热议各家模型的 KV 缓存复用架构。YOCO(You Only Cache Once)设计简单:模型前半部分为普通结构,将隐藏状态再投影得到 K/V 后,后半段所有层共享同一份 KV 缓存。DeepSeek 的 CED 与 YOCO 思路类似,应用于 CSA2 层的全局分支,每层各自独立,且只缓存编码器 KV。GLM 5.2 则在保持灵活性的同时,将「按块打分」变为「按 token 打分」,块内共享 block index 以获得性能收益,各家命名与共享方式引发讨论。

第 15 集 · DeepSeek V4.1 Flash 技术深读:KV cache 压缩造就高效旗舰(2026-09-11,7 条)

@nrehiew 于 09-11 发布 DeepSeek V4.1 Flash 技术深读长线程,主线是「对 KV cache 压缩的偏执」如何造就一个超高效的旗舰级模型。系列覆盖多模态预训练、优化器与超参、训练基建、注意力 indexer、全局注意力与核心架构设计等多个层面。

已确认

  • 多模态预训练:45T 图文 token 预训练,自研图像编码器(视觉部分采用 Siglip 风格编码器),并引入模态级 load balancing——这一点让作者联想到原始 Chameleon 的做法
  • 优化器:采用 head-wise Muon,包含视觉模型;sparse attention 无需 warmup 从头训练;196B 参数 Engram 配 Sinkhorn 平衡
  • 训练基建:视觉编码器的关键洞察是计算一个模态时可并行 all-gather 另一模态的特征;对超长多图序列应用 context parallelism
  • 注意力 indexer:indexer 本身也是稀疏的——第一个 full mode indexer 先选出候选,后续层再用这些候选打分,形成分层筛选结构
  • 全局注意力:本质是升级版压缩注意力,三种变体都先在小 KV 上跑 indexer 做选择,再与窗口化 KV 拼接后进入注意力;区别在于 KV 复用方式——不复用、复用早层 KV 等
  • 核心架构:20 层 encoder + 20 层 decoder 的 YOCO 式 decoder-decoder 设计,针对 prefill 昂贵的问题,下半层生成 KV cache 后经逐层投影共享给上半层,可理解为一种将 KV cache 减半的手段

为什么重要

该系列系统性地展示了 KV cache 压缩贯穿模型设计各处——从架构、注意力机制到 indexer 结构——是理解这一高效旗舰模型工程取舍的完整技术参考。