专题 · FULL STORY
DeepSeek V4.1 Flash:从内测到开源实测
DeepSeek V4.1 Flash 于 9 月 8 日以中间版本开启限时内测,9 月 10 日正式发布并开源,三端同步上线并降价。实测显示其性能逼近前沿模型,KV Cache 缩小 4 倍,登顶 Vals 开源榜,引发架构与安全热议。
2026-09-08 ~ 2026-09-11 · 15 集 · 154 条
第 1 集 · DeepSeek V4.1 Flash 限时内测:新架构原生多模态(2026-09-08,18 条)
9 月 8 日,多个消息源先后披露 DeepSeek V4.1 Flash 已以「中间版本」形式开启限时内测,模型 ID 为 deepseek-v4.1-flash-expires-on-0910,slug 中的日期表明该内测于 9 月 10 日过期。核心升级点是全新模型架构与原生多模态支持,官方口径称能力更强、速度更快、成本更低。调用方式、计费与并发规则已基本明确,开发者实测陆续出现,模型还悄然现身 Hugging Face,但正式公开公告与完整能力评测仍待官方发布。
已确认
- 机器之心报道称 DeepSeek 官方宣布 V4.1 Flash 中间版本开始内部测试,主要升级为全新模型架构、原生多模态、能力更强速度更快成本更低;APPSO、智东西、aigclink、赛博禅心等也确认了同一消息。
- 调用方式:保持 baseurl 不变,将模型名设为以 deepseek-v4.1-flash-expires-on-09 开头的 ID(如 deepseek-v4.1-flash-expires-on-0910)。APPSO、tokenbender、kimmonismus 等指出该日期即过期时间。
- 据 vista8 转述的官方微信群通知,计费与 V4 Flash 相同,单账号最多 20 并发;teortaxesTex 提到的泄露信息同样指向并发仅 20,并称该中间版本带有视觉能力(V4-Flash-Vision [Intermediate])。
- 价格方面,MiaAIlab 经 MicahBerkley 转述称该版本价格极为激进,约 1 美元可消耗 5800 万 token,且限时约 2 天可用。
- 第三方账号 LuminaBench 发现 DeepSeek 正在 API 上测试该中间构建版本,tokenbender 认为这或为正式版前哨。
- 实测表现:9 月 10 日 Kevin Kern 试用了预览端点,推理速度约 300 tok/s,并在其任务中大量并行调用子代理;他同时指出预览端点暂不支持视觉输入,期待正式版补齐多模态。智东西的报道则提到输出最快可达 507 tokens/s。
- 9 月 10 日,Reddit 用户发现 Hugging Face 上出现 deepseek-ai/DeepSeek-V4.1-Flash 模型页面,疑似官方已悄然上传;具体规格与能力信息尚不明确,未经官方公告证实。
尚未确认
- 消息最初由 op7418、AGI Hunt 等博主从 DeepSeek 官方微信群传出,当时均强调未经官方公开发布公告证实;后被机器之心以「官方宣布」口径报道,但正式公开公告与完整能力细节仍待官方发布。
- 网友 @NFTChen(经 solyarisoftware 转发)爆料称 V4.1 Flash 预计北京时间 9 月 10 日前后正式发布,且 V4 Pro 请求将按 Flash 价格路由;该说法未经 DeepSeek 官方一手确认。
- 预览端点不支持视觉输入与「原生多模态」的官方说法之间存在张力,正式版是否补齐视觉能力尚待验证(Kevin Kern 亦仅表达期待)。
- teortaxesTex 转引 @xhyctf 及网友调侃称希望其至少在视觉之外能打赢 GLM 5.3 Flash,仅为社区观点,无评测依据。
为什么重要
- 这是 DeepSeek 首次被曝以「中间版本(expires-on)」形式放出限时内测,且计费与并发规则同步明确,配合激进定价,显示其在正式发布前通过开发者实测快速迭代、并借限时窗口收集大规模真实负载的产品节奏。
- 原生多模态意味着 DeepSeek 主力模型路线的重大升级;实测已给出约 300 tok/s 的速度参考,且模型已现身 Hugging Face,社区正将其与 GLM 5.3 Flash 等竞品对标,正式版发布后的多模态与能力实测值得持续关注。
- DeepSeek V4.1 Flash 内测:调用方式与限流细节曝光 — 赛博禅心 · 2026-09-08
- 传 DeepSeek V4.1 Flash 曝光,网友调侃盼其超越 GLM 5.3 Flash — teortaxesTex · 2026-09-08
- DeepSeek V4.1 Flash 中间版本开启内测,原生多模态 — AGI Hunt · 2026-09-08
- 传 DeepSeek V4.1 Flash 发布:原生多模态增强 — op7418 · 2026-09-08
- 曝 DeepSeek V4.1 Flash 开启内测:新架构原生多模态,计费不变 — vista8 · 2026-09-08
- DeepSeek V4.1 Flash 中间版开启内测:原生多模态、更快更便宜 — jiqizhixin · 2026-09-08
- DeepSeek 疑似内测 V4-Flash-Vision:全新架构原生多模态,并发仅 20 — teortaxesTex · 2026-09-08
- DeepSeek V4.1Flash 中间版本开启内测:新架构、原生多模态,输出最快 507 tokens/s — 智东西 · 2026-09-08
- DeepSeek V4.1 Flash API 低调开测:新架构+原生多模态,或为正式版前哨 — tokenbender · 2026-09-08
- DeepSeek 开启 V4.1Flash 限时内测:新结构原生多模态,9月10日过期 — APPSO · 2026-09-08
- 曝 DeepSeek V4.1 Flash 中间版本内测:原生多模态、更快更便宜 — aigclink · 2026-09-08
- DeepSeek Flash 4.1 曝已上线 API 测试,采用新架构提速 — kimmonismus · 2026-09-08
- DeepSeek V4.1 Flash 开放内测:原生多模态,价格与 V4 持平 — Nunki08 · 2026-09-08
- DeepSeek 限时放出 v4.1 Flash:1 美元可烧 5800 万 token — MicahBerkley · 2026-09-09
- 曝 DeepSeek v4.1 flash 预览端点上线,速度约 300 tok/s — kevinkern · 2026-09-10
- DeepSeek v4.1 Flash 预览曝光:约 300 tok/s,大量并行子代理 — kevinkern · 2026-09-10
- 爆料称 DeepSeek V4.1 Flash 即将发布,V4 Pro 请求将按 Flash 价格路由 — solyarisoftware · 2026-09-10
- Reddit 发现 DeepSeek-V4.1-Flash 已悄然现身 Hugging Face — t4a8945 · 2026-09-10
第 2 集 · DeepSeek V4.1 Flash实测:极速350 tokens/s但偏实验性(2026-09-08,2 条)
多位开发者和博主对DeepSeek实验性模型V4.1-Flash进行实测:YouTuber WorldofAI和开发者ivanfioravanti均报告解码速度约300-400+ tokens/秒,价格也具竞争力,速度表现令人印象深刻。但该模型仍处实验早期,且被指有「爱过度思考」的倾向,整体更适合作为极速、低成本的预览选项而非生产级选择。
- DeepSeek V4.1-Flash 实测:350 t/s 极速但仍处实验早期 — teortaxesTex · 2026-09-08
- DeepSeek V4.1 Flash 实测:300-400 tokens/s、便宜快速但爱过度思考 — WorldofAI · 2026-09-09
第 3 集 · DeepSeek V4-Flash 降价并改峰谷计费,9 月 10 日生效(2026-09-08,6 条)
DeepSeek 宣布自北京时间 9 月 10 日 12:00 起下调 V4-Flash(flash)系列 API 定价,输入价格回到此前涨价前水平,并改为峰谷分时计费,错峰时段降幅最大。此前一天社区渠道已泄露价格表,随后官方公告确认。新方案将接替此前生效的 "Intermediate" V4.1 定价。
已确认
- DeepSeek 开放平台公告:9 月 10 日 12:00 起 V4-Flash 系列降价(机器之心、量子位、aigclink 转述官方公告)。
- 闲时定价(元/百万 token):缓存命中输入 0.02 元(由 0.05 元下调,降 60%);缓存未命中输入 1 元(由 1.5 元下调,降 33.33%);输出 4 元(由 4.5 元下调,降 11.11%)。
- 高峰时段为工作日 9:00–12:00、14:00–18:00,其余为闲时;高峰时段价格高于闲时,具体数值以官方价目为准。
- 此前生效的 "Intermediate" V4.1 定价方案到期后由新方案接替(teortaxesTex 汇总)。
- 第三方渠道价格更低:michaelsoftbinbows 指出 OpenRouter 上经 openinference 接入的 DeepSeek V4 Flash(0731)非峰时价格仅输入 $0.05 / 输出 $0.16 每 1M tokens,低于官方定价($0.22 起),引发热议。
尚未确认
- 公众号「赛博禅心」提及新方案伴随 20 并发限制,标注待官方最终确认,官方公告未见明确说明。
时间线
- 09-08:teortaxesTex 汇总泄露的新价格体系;「赛博禅心」同日发布降价消息,含 2026 年 9 月 10 日 12:00 生效时间与并发限制细节,待官方确认。
- 09-09:量子位、机器之心、aigclink 等报道,DeepSeek 官方公告确认降价;同日 OpenRouter 第三方低价引发讨论。
- 09-10 12:00:新价格正式生效。
为什么重要
- 输入价格回到涨价前水平,意味着此前涨价被部分回撤,对依赖 DeepSeek API 的开发者与厂商成本直接利好。
- 错峰缓存命中低至 0.02 元/百万 token,叠加峰谷分时计费,将引导用户错峰调用、提高缓存利用率,也反映 DeepSeek 供给能力与调度策略的变化。
- 官方与第三方渠道(如 OpenRouter)价差显著,为开发者提供了更低成本的替代接入途径。
- DeepSeek flash 系列大幅降价:闲时输入降至 1 元/百万 token,限 20 并发 — 赛博禅心 · 2026-09-08
- DeepSeek 新定价曝光:输出加价、错峰缓存命中低至 0.02 元 — teortaxesTex · 2026-09-08
- DeepSeek flash 系列再降价:闲时输入降至 1 元/百万 token — 量子位 · 2026-09-09
- DeepSeek flash 系列降价:缓存命中输入最高降 60%,分峰谷时段计费 — aigclink · 2026-09-09
- DeepSeek V4 Flash 非-峰时价格低至 0.05/1M,比小模型还便宜引热议 — michaelsoft__binbows · 2026-09-09
- DeepSeek宣布V4-Flash降价:输入价格回到涨价前,9月10日生效 — 机器之心 · 2026-09-09
第 4 集 · DeepSeek V4.1 Flash 多场景实测:近前沿性能、超低成本(2026-09-09,15 条)
DeepSeek V4.1 Flash 及同日开放的 V4.1 Flash Vision Beta 在发布后数日内接受多轮独立实测,普遍结论是性能逼近甚至部分追平前沿闭源模型,而成本仅为对方的约百分之一到三十分之一;Artificial Analysis 的量化评测(智能指数 40,113 个模型中排第 6)也从榜单维度印证了这一位置。设计、安全、代码、知识工作、视觉、终端代理与本地部署等多个场景的测试相互印证了这一性价比。
已确认
- 权威榜单:Artificial Analysis 公布 V4.1 Flash(推理版,Max Effort)评测结果:智能指数 40,在 113 个模型中排第 6,吞吐约 190 tokens/秒;该模型为开放权重,2026 年 9 月发布。
- 设计类横评:博主 NFTChen 在日常设计任务横评中测得 DeepSeek V4.1 Flash 得 81.2 分,达到 GPT-6 Astra(82.7 分)的 98%,超过 Claude Fable 5.1 的 80.3 分,成本约为 Astra 的 1.4%;uxl 转述的 OpenDesign Arena 榜单数据显示类似性价比,ChrisUniverse 转述的 OpenDesignHQ 评测还指出除 Astra 外其他模型分数更低且成本更高(真伪未获官方证实)。
- 网络安全基准:pilvar222 团队测试 V4.1 Flash 单次运行可重新发现基准中 65.6% 的近期 CVE(旧版 55.2%),pass@3 下捕获率达 84.4%(旧版 75%),追平前沿模型。
- 代码修 bug 实测:Pawel Huryn 用 2 个仓库、105 个隐藏真实 bug 测试,V4.1 Flash 成绩进入 Pareto 前沿——作为参照,Opus 5 (max) 找到 27 个、成本 $51.33,Grok 4.6 (max) 同为 27 个、成本 $16.96,而 V4.1 Flash 成本约为 Opus 的 3.5%(约 1/28 价格);作者还补充 FAQ 回应常见质疑。该结果被 sander、soveLight 等多个账号独立转述,sander 转述版本给出 V4.1 Flash 得 24 分。
- 知识工作实测:博主 himanshustwts 团队用同一批 22 个内部任务(覆盖工程、业务运营、金融、医疗)横向评测 11 个前沿模型,V4.1 Flash 在 KnowledgeWork 评测中拿到 15/21 通过、接近 SOTA,成本仅为竞品的约 2%;任务平均含 120+ 验证器、以 GPT-5.5 为裁判,整套跑完成本仅 $0.34。
- 视觉能力:Reddit 用户 cheezeerd 在发布当天对 V4.1 Flash Vision Beta 与 V4 Flash Vision 做 5 项视觉任务对比,并附完整视频走查首稿与三轮修订结果,结论是新版本输出质量明显更好、更可靠,且 API 定价更低。
- 代码代理表现与定价:dejavucoder 转述 Cline 官方引用的消息称,V4.1-Flash 发布不到一个月即在 Terminal-Bench 上超越 V4-Pro 0813 版本;定价为每百万 token 输入 0.30 美元起,约为 Opus 的 1/20。
- 本地部署:TheZachMueller 转述的开发者实测显示,DeepSeek 4.1 Flash 以全精度配合 DSpark 引擎,在 4 颗 Apple Max-Q 芯片、仅 64GB 系统内存的机器上跑出约 200 TPS,关键技巧是对约 200GB Engram 的处理。
尚未确认
- 除 Artificial Analysis 榜单外,各项成绩均来自第三方个人或团队测试,样本与评测方法各异;OpenDesignHQ 评测真伪未获官方证实;Terminal-Bench 超越 V4-Pro 一说源自 Cline 官方引用的消息;Mac 本地 200 TPS 数据为单一开发者实测,官方指标和大规模复现结果均尚未见。
为什么重要
- 多个独立来源、不同任务类型的测试相互印证 V4.1 Flash 的性价比,而非单一榜单的孤证;Artificial Analysis 的排名进一步提供了中立第三方的量化背书。
- 若结果可复现,超低价近前沿模型将进一步压缩闭源旗舰模型的定价空间,并降低开发者与企业的迁移门槛。
- 能在消费级 Apple 硬件上全精度高速运行,意味着该模型还具备本地化、私有部署的吸引力,扩展了应用场景。
- DeepSeek V4.1 Flash Vision Beta 实测:5 项视觉测试全面碾压上代 — cheezeerd · 2026-09-09
- 实测 DeepSeek V4.1 Flash Vision Beta:三版修订后质量大幅提升 — cheezeerd · 2026-09-09
- DeepSeek V4.1 网络安全评测大跃升:单次找回 65.6% CVE,追平前沿模型 — teortaxesTex · 2026-09-09
- DeepSeek v4.1 Flash 以 1.4% 成本达到 Astra 98% 分数 — uxl · 2026-09-09
- 博主实测:DeepSeek V4.1 Flash 得分达 GPT-6 Astra 的 98%,成本仅 1.4% — solyarisoftware · 2026-09-10
- 实测 105 个隐藏 bug:DeepSeek V4.1 Flash 以 1/28 价格逼近 Opus — PawelHuryn · 2026-09-10
- 105 个真实 bug 实测:DeepSeek V4.1 Flash 成本仅 Opus 的 3.5% — PawelHuryn · 2026-09-10
- 实测 105 个隐藏 bug:DeepSeek V4.1 Flash 逼近 Opus,成本仅 1/28 — soveLight · 2026-09-10
- DeepSeek V4.1-Flash 发布不到一月超越 V4-Pro,成本低至 Opus 的 1/20 — dejavucoder · 2026-09-10
- 105 个隐藏 Bug 实测:DeepSeek V4.1 Flash 得 24 分,成本仅 Opus 5 的 1/28 — sanderjson · 2026-09-10
- 22 项知识工作实测 DeepSeek-V4.1-Flash,全程仅花 $0.34 — realsohamparekh · 2026-09-10
- 第三方评测:DeepSeek V4.1 Flash 以 1.4% 成本达 GPT-6 98% 水平 — ChrisUniverse · 2026-09-10
- 内部评测:DeepSeek V4.1 Flash 近 SOTA,成本仅为竞品 2% — himanshustwts · 2026-09-11
- DeepSeek 4.1 Flash 全精度跑上 Mac:4 颗 Max-Q 达 200 TPS — TheZachMueller · 2026-09-11
- DeepSeek V4.1 Flash 评测:智能指数 40,190 tokens/秒 — ArtificialAnlys · 2026-09-11
第 5 集 · DeepSeek 发布 V4.1-Flash:552B MoE 低价反超旗舰(2026-09-09,56 条)
DeepSeek 于 9 月 10 日正式发布并开源新模型 V4.1 Flash,在网页、App 与 API 三端同步上线,API 模型名为 deepseek-flash,权重以 MIT 协议上架 Hugging Face(提供 fp8/8-bit 版本,支持 transformers 部署)。官方称其性能、费用、速度全面超越自家旗舰 V4 Pro,价格大幅下降,是近期最受关注的开源模型发布之一。
已确认
- 架构与规模:552B 总参数的非对称 MoE,采用全新 Causal Encoder-Decoder 架构,输入侧仅激活 8B 参数、输出侧激活 16B,支持最高 100 万 token 上下文,借助跨层共享的压缩 KV Cache 等技术节省 7/8 的 KV 缓存开销(@YuchenjUW 称 KV cache 每 token 体积再降 4 倍),并采用两阶段稀疏索引器等设计。官方称非对称激活与 KV 缓存节省是跑赢旗舰的关键。
- 多模态与生态:这是 DeepSeek 新架构家族中首个原生支持视觉理解(image-text-to-text)的模型,也是该家族目前最小的成员,可为更大规模模型铺路;vLLM 与 SGLang(含 RL 框架 Miles)均提供零日支持,LMSYS 团队发布技术博客拆解新架构,并已在 NVIDIA/AMD GPU 上验证。官方公开征集 2000 GPU + 存储集群级别的大规模部署合作,并附论文。
- 定价与基准:官方公布新定价,谷峰价差 50%;社区转述输入价格约 $0.14-0.15/M、输出约 $0.60/M;@kimmonismus 称输出价格仅为 GPT-5.6 Sol 的 6%,@YuchenjUW 称整体成本约为其 3%。据 Artificial Analysis 数据,V4.1 Flash 在其 Intelligence Index 得分 40,反超自家 1.6T 参数的 Pro 旗舰,而 token 价格便宜约 4 倍;社区帖称 DeepSWE v1.1 得分 74.2%、CyberGym 88.1 vs 84.5,API 成本约为 Opus 5 的 2.5%。
- V4 Pro 退役与路由:官方公告称,在 V4.1 Pro 上线前,所有 V4 Pro 请求将被自动路由到 V4.1 Flash 并按更低价格计费;据 @markk 转述,9 月 14 日起 V4 Pro 请求即切换。旧模型 V4-Flash 与 V4-Flash-Vision-E 等也将退役。V4.1 Flash 距 7 月的 V4-Flash 发布仅约六周,迭代节奏明显加快。
- 行业反应:Hugging Face 联合创始人 Thom Wolf 称该模型重回开源排行榜榜首且价格极低,并制作前向传播可视化视频展示其推理设计;多位研究者将其视为近期最重要的模型发布之一。Redis 作者 antirez 则持保留态度,认为相比上一代 4.0 Flash 并非质的飞跃——backbone 参数翻倍仅带来小幅领先。
尚未确认
- 部分转发帖(@solyarisoftware)出现 769B 总参数的说法,与官方口径的 552B 不一致,以官方 552B 为准。@ns123abc 称每百万 token 成本约为竞品的 1/86、输出速度 420-507 tok/s(快于 Gemini),该说法源自网络爆料,数字待独立验证。
为什么重要
- 以极低的激活参数量和成本达到超越旗舰 V4 Pro 的表现,配合 MIT 开源,可能进一步压低行业推理价格并冲击闭源厂商;但如 antirez 所指出的,相对前代的代际提升幅度存在争议。
- V4 Pro 用户需注意 9 月 14 日前后自动路由带来的行为变化,依赖其能力的开发者应在切换前评估实际表现。
- 百万 token 上下文、原生视觉与 7/8 的 KV 缓存节省,对长文档与智能体工作流场景的可用性和成本有直接影响;该模型还为同架构家族更大规模模型铺路。
- DeepSeek:V4 Pro 请求将被路由到更快的 V4.1 Flash 并降价计费 — zephyr_z9 · 2026-09-09
- DeepSeek 发布 V4.1 Flash,综合成本降 22% 且性能更强 — deliprao · 2026-09-09
- DeepSeek 发布 V4.1 Flash:552B MoE 新架构,MIT 开源 — deepseek-ai · 2026-09-10
- DeepSeek 发布 V4.1 Flash:552B MoE 超旗舰,降价并下线 V4 Pro — DeepSeek · 2026-09-10
- DeepSeek 发布 V4.1-Flash:原生视觉理解的新架构家族首发 — deepseek_ai · 2026-09-10
- 非对称新架构:552B MoE 输入仅激活 8B,跑分超自家旗舰 — deepseek_ai · 2026-09-10
- DeepSeek-V4.1-Flash 上线 API:KV 缓存省 7/8,V4-Pro 将被淘汰 — deepseek_ai · 2026-09-10
- V4.1-Flash 开源上架 HF:MIT 协议,谷峰价差 50%,附论文 — deepseek_ai · 2026-09-10
- DeepSeek V4.1 Flash 发布:552B MoE 仅激活 8B,价格低至 $0.14/M — ChrisGPT · 2026-09-10
- DeepSeek 疑将下线 v4 Pro,请求全部转向新版 v4.1 Flash — gaganghotra_ · 2026-09-10
- DeepSeek V4.1 Flash 开源发布:552B MoE、1M 上下文、SGLang 零日支持 — BanghuaZ · 2026-09-10
- V4.1 Flash 详解:每 token 缓存缩至 890 字节,闲时命中仅 2 分 — 赛博禅心 · 2026-09-10
- DeepSeek 开源 V4.1 Flash:552B 非对称 MoE 架构,砍掉 V4 Pro — 机器之心 · 2026-09-10
- DeepSeek-V4.1-Flash 现身 Hugging Face:MIT 协议、多模态、FP8 权重 — AIFlow_ML · 2026-09-10
- DeepSeek V4.1 Flash 权重开源上线 HF,MIT 协议支持图文输入 — solyarisoftware · 2026-09-10
- DeepSeek 发布 V4.1-Flash:新架构家族最小型号带原生视觉 — eliebakouch · 2026-09-10
- DeepSeek 发布 V4.1-Flash:新架构家族最小模型,原生视觉理解 — reach_vb · 2026-09-10
- DeepSeek 发布 V4.1-Flash:新架构家族最小模型,原生视觉理解 — teortaxesTex · 2026-09-10
- DeepSeek 发布 V4.1-Flash:新架构家族最小模型,原生视觉理解 — basedjensen · 2026-09-10
- DeepSeek V4.1 Flash 上线 App/Web/API,开源权重照旧 — gaganghotra_ · 2026-09-10
第 6 集 · DeepSeek V4.1 Flash 爆料:552B 非对称架构对标 GPT-5.6(2026-09-10,20 条)
9 月 10 日,多位博主集中曝光了据称是 DeepSeek V4.1 及 V4.1 Flash 的官方基准成绩与技术细节,Sentdex 于次日称权重已放出。若属实,V4.1 将以 552B 非对称激活架构在多项 agentic/编码基准上正面挑战 GPT-5.6 Sol,并凭极致 KV 压缩大幅压低推理显存与成本,还带来 1-100 连续可调推理力度等罕见设计。官方尚未确认任何信息,iScienceLuvr 等博主公开质疑成绩可能存在刷榜成分。
已确认
- 信息均为未经官方证实的爆料,主要来自 teortaxesTex、eliebakouch、ChrisGPT、nrehiew、iScienceLuvr、AdinaYakup、zainhas、Sentdex 及 @sheriyuo(经 AndrewZhao 转发)、@MiaAIlab(经 airesearch12 转发)等博主,各帖数据相互印证;另有 SemiAnalysis 发帖「祝贺」发布(经 bodonoghue85 转发)。
- 模型总参数 552B,采用全新 Causal-Encoder-Decoder 架构,输入激活 8B、输出激活 16B;nrehiew 补充称同一模型在预填充与解码两个阶段激活不同数量的参数(解码 8B、预填充 16B),属此前少见的设计。多个来源强调其成本显著低于同尺寸模型,sheriyuo 称其「智能超自家旗舰」;MiaAIlab 称其能力大致持平或优于 GPT-5.6 Sol、Claude Opus 5、GLM 5.3 和 Kimi K3 等一线模型;Sentdex 援引的原推称权重已放出,模型比前代大不少,并在多个关键领域超过 Opus-5、GPT-5.6-Sol、Kimi-K3 和 GLM-5.3。
- 曝光跑分:TerminalBench 4.0 得 31.2,CyberGym 88.1(对比 GPT-5.6 Sol 的 84.5),HLE 63.9;ChrisGPT 称多项 agentic/编码基准超越 GPT-5.6 Sol;nrehiew 称 V4.1 Flash 在 DeepSWE 以 74.2 分登顶,超过 Opus 5 与 Gemini 3.8 Flash。
- eliebakouch 引述的技术报告显示 V4.1 Flash 为原生视觉模型,训练于 45T tokens,架构被赞为近年最新颖;AdinaYakup 称其原生视觉能力合并到同一端点。
- zainhas 连发三帖指出,V4.1 Flash 支持 reasoningeffort 从 1 到 100 连续可调,而非业界常见的 low/medium/high 离散档位,并罕见提供 API 兼容映射;其称此前未见过任何模型采用这种设计,其中一帖附上了据称是该模型的论文链接。
架构与工程亮点
- 据 teortaxesTex 爆料,KV cache 压缩至 890 字节/token,百万 token 不足 1GB;相比 V4-Flash,HBM 需求再降 3.9 倍,SSD 需求降 8 倍,且发布半年后仍未被超越。AdinaYakup 称 KV 缓存缩至首代的 1/437,HBM 占用为上一代 1/4、SSD 为 1/8。
- Scobleizer 转发的信息补充定价:$0.15 输入 / $0.60 输出每百万 token,AdinaYakup 称价格仅为 Opus 的四十分之一。
- 同据 teortaxesTex(经 zephyrz9 转发),V4.1 砍掉 V4 的临时补丁:放弃 HCA、将 CSA 泛化为更通用原语、去掉稀疏注意力的 warmup 阶段、采用更简单的单遍 mHC;另提及新的稀疏注意力设计(经 donglixp 转述)。
尚未确认
- 所有跑分、参数规格、定价、架构细节及权重放出的说法均无官方来源,最终发布版本可能存在差异;iScienceLuvr 明确表示对「GPT-5.6 Sol 级别」的成绩持怀疑态度,怀疑存在刷榜成分,相关帖中也出现「benchmarkmaxxed」的质疑。
为什么重要
- 若爆料属实,V4.1 在 agentic/编码能力上正面挑战 GPT-5.6 Sol,同时凭借不对称激活与极致 KV 压缩大幅降低部署显存门槛;1-100 连续推理力度若属实,也将为 API 侧的推理成本与深度调控提供新的交互范式,在开源开放生态下对推理成本影响显著。
- 曝 DeepSeek V4.1 跑分:552B 新架构,HLE 63.9、TerminalBench 31.2 — teortaxesTex · 2026-09-10
- DeepSeek V4.1 架构再进化:HBM 需求降至 1/3.9,跑分全面刷新 — teortaxesTex · 2026-09-10
- KV 压至 890 字节/token:DeepSeek V4.1 Flash 显存需求降 3.9 倍 — teortaxesTex · 2026-09-10
- 曝 DeepSeek V4.1 Flash:552B MoE 非对称架构,智能超自家旗舰 — _AndrewZhao · 2026-09-10
- DeepSeek V4.1 Flash 跑分曝光:编码与 agent 基准多项超 GPT-5.6 Sol — ChrisGPT · 2026-09-10
- DeepSeek V4.1 Flash 曝光:552B 总参、原生视觉,架构被赞近年最新颖 — eliebakouch · 2026-09-10
- 爆料称 DeepSeek V4.1 砍掉 V4 补丁:弃 HCA、泛化 CSA、免稀疏预热 — zephyr_z9 · 2026-09-10
- DeepSeek V4.1 Flash 登顶 DeepSWE:74.2 分超 Opus 5 与 Gemini 3.8 Flash — nrehiew_ · 2026-09-10
- 曝 DeepSeek-V4.1-Flash 支持 1-100 连续可调推理强度 — zainhas · 2026-09-10
- 曝 DeepSeek 发布 V4.1-Flash:552B 参数自称达 GPT-5.6 水平 — iScienceLuvr · 2026-09-10
- 曝 DeepSeek-V4.1-Flash 支持 1-100 连续可调推理力度 — zainhas · 2026-09-10
- 曝 DeepSeek V4.1 Flash 为不对称激活 MoE,成本远低于同尺寸模型 — gaganghotra_ · 2026-09-10
- DeepSeek-V4.1-Flash 推理力度 1-100 连续可调,还罕见提供 API 兼容映射 — zainhas · 2026-09-10
- 552B只激活8B:DeepSeek V4.1 Flash效率数据曝光 — Scobleizer · 2026-09-10
- DeepSeek V4.1-Flash:KV缓存缩至首代1/437,价格仅为Opus四十分之一 — AdinaYakup · 2026-09-10
- 爆料称 DeepSeek v4.1 Flash 比肩或超越 GPT-5.6 Sol 与 Claude Opus 5 — airesearch12 · 2026-09-10
- 曝 DeepSeek-V4.1-Flash:552B 架构仅激活 8B,KV 缓存降 8 倍 — bodonoghue85 · 2026-09-10
- 曝 DeepSeek V4.1 Flash:552B 总参数、新稀疏注意力与原生视觉 — donglixp · 2026-09-10
- DeepSeek V4.1-Flash 引热议:552B 参数对标 GPT-5.6 — teortaxesTex · 2026-09-10
- KOL 实测视角:DeepSeek V4.1 Flash 多项关键指标超 Opus-5 — Sentdex · 2026-09-11
第 7 集 · DeepSeek V4.1 Flash 评测跑分流出,社区热议实测表现(2026-09-10,2 条)
DeepSeek V4.1 Flash 发布后,Reddit 等社区流传出该模型的首批评测成绩截图,成为与其他前沿模型对比的依据之一。网友转发的截图显示,该模型在 deepswe 榜单上达到 SOTA,与 sol 和 fable5 同列,并在 terminal bench 上表现出较强竞争力,整体跑分亮眼,引发社区热议。
- 曝 DeepSeek v4.1 flash 跑分亮眼:deepswe SOTA、terminal bench 竞争力强 — zainhas · 2026-09-10
- DeepSeek V4.1 Flash 评测成绩图流出,社区热议实测表现 — toastisthicc · 2026-09-10
第 8 集 · Bug Hunt Bench 实测 105 个真实 Bug,DeepSeek V4.1 Flash 高性价比夺目(2026-09-10,8 条)
Pawel Huryn(The Product Compass 作者)发布并运营 Bug Hunt Bench 基准:在两个生产代码库中人为埋入 105 个真实 bug,让 GPT-6、Claude、Grok、Gemini、DeepSeek、Kimi、GLM 等前沿模型在各自 agentic 配置下修复,按修复数量盲评排名,每个仓库只给一次提示,满分 105,结果持续更新于其 GitHub 榜单页面。
已确认
- GPT-6 Astra 补测成绩:low 档 27/105、medium 档 34/105,结果此前已于 9 月 4-5 日发布,可在榜单页面用过滤器对比查看。
- DeepSeek-V4.1-Flash(high 档):max effort 下修复 24/105,总花费仅 $1.80,耗时 42.6 分钟。
- Huryn 复测发现 V4.1 Flash 明显优于 V4 Pro:DeepSeek V4 Pro(max)仅 16/105,花费 $1.89、耗时 37 分钟,即 Flash 得分更高还更便宜。
为什么重要
- 该基准用真实仓库预埋 bug、盲评、单次提示的设定,比传统合成基准更贴近实际修 bug 场景。
- Huryn 强调 DeepSeek-V4.1-Flash 以约 $1.80 的成本修复 24 个 bug,在同级价格中性价比突出,且反超自家更贵的 V4 Pro,为预算敏感的团队提供了有参考价值的选型数据。
- Bug Hunt Bench 实测 105 个真实 bug,DeepSeek-V4.1-Flash 高性价比夺目 — PawelHuryn · 2026-09-10
- Bug Hunt Bench 上架 Astra 成绩:低档 27 中档 34 分 — PawelHuryn · 2026-09-10
- 同场基准补测:GPT-6 Astra 低档 27 分、中档 34 分修 Bug — PawelHuryn · 2026-09-10
- 实测 105 个隐藏 bug:DeepSeek V4.1 Flash 修复 24 个,成本仅 Opus 1/28 — AlexSed90 · 2026-09-10
- DeepSeek V4.1 Flash 实测:24/105 仅花 $1.80,碾压同级价格 — PawelHuryn · 2026-09-10
- Bug Hunt Bench 用 105 个真实埋入 Bug 排名前沿编程模型 — PawelHuryn · 2026-09-10
- DeepSeek V4.1 Flash 实测反超 V4 Pro:得分更高还更便宜 — PawelHuryn · 2026-09-10
- Bug Hunt Bench 上线:前沿编码模型盲评修复 105 个植入 bug — PawelHuryn · 2026-09-10
第 9 集 · DeepSeek V4.1 Flash 架构解析:YOCO 灵魂与 KV 缓存复用(2026-09-10,7 条)
9 月 10 日,多位博主集中讨论 DeepSeek 新模型 V4.1 的架构变化:DeepSeek 被指回归编码器-解码器架构,并在架构层面做出多项创新且全面开源,被认为持续拉高了 AI 研究生态的技术下限。当前这些信息多来自论文细节与 KOL 分析,官方口径尚不统一,架构定名仍存争议。
已确认
- DeepSeek 将新架构相关技术信息公开开源。
- Astra Pro 深读 V4.1 论文发现,DeepSeek 在不同 checkpoint 之间复用 KV 缓存,被评论者称为「奇怪的模型工厂」。
- DeepSeek 引用 2024 年的 YoCo(You Only Cache Once)论文作为其 Causal-Encoder Decoder(CED)transformer 模块的主要灵感来源。
尚未确认
- 据 KOL MaxForAI 对 V4.1 Flash 论文结构图的分析(未经官方确认),模型至少有三大架构变化:回走编解码结构、引入 CSA2 跨层复用等,真正值得关注的是对 Transformer 本体的改动而非参数或跑分。
- 开发者 aHapBean 认为「Causal Encoder-Decoder」名不副实:V4.1 可能仍是 decoder-only LLM,该命名夸大了架构革新,更准确的说法应参考 YoCo 的思路。
为什么重要
- @evijit 指出,DeepSeek 连续在架构级而非仅规模层面创新并开源,抬升了整个开源社区的技术下限。
- KV 缓存在 checkpoint 间复用等做法若属实,可显著降低训练与部署成本,对推理经济性有直接影响。
- DeepSeek 回归 encoder-decoder 架构,新架构改动全面开源 — evijit · 2026-09-10
- DeepSeek V4.1 Flash 再改 Transformer:回走编解码结构、CSA2 跨层复用 — evijit · 2026-09-10
- DeepSeek 自曝 CED 架构灵感来自 2024 年 YoCo 论文 — jm_alexia · 2026-09-10
- DeepSeek V4.1 论文藏细节:在 checkpoint 之间复用 KV 缓存,被称「奇怪的模型工厂」 — teortaxesTex · 2026-09-10
- 「因果编码器-解码器」名不副实?DeepSeek V4.1 架构被指更像 YOCO — donglixp · 2026-09-10
- 曝 DeepSeek V4.1 Flash 采用 YOCO 架构,KV 缓存数量级优化 — donglixp · 2026-09-11
- DeepSeek 研究员:V4.1 Flash 采用 YOCO 架构,架构创新进入下半场 — donglixp · 2026-09-11
第 10 集 · DeepSeek V4.1 Flash 架构解析:非对称设计与省成本机制(2026-09-11,2 条)
DeepSeek 最新技术报告披露 DeepSeek-V4.1-Flash 全新架构。多位技术博主逐层拆解发现:该模型采用非对称因果编码器-解码器结构与 CSA2 注意力机制,拥有百万 token 上下文窗口,但也带来「为保留上下文付费」的第二重成本。整体设计同时压低计算与内存开销,在长上下文场景下兼顾性能与成本。
- DeepSeek-V4.1-Flash 架构详解:非对称编码器-解码器与 CSA2 注意力 — teortaxesTex · 2026-09-11
- DeepSeek V4.1 Flash 架构解析:552B MoE 读写算力不对称省上下文成本 — demian_ai · 2026-09-11
第 11 集 · DeepSeek 新模型技术报告:KV Cache 缩小 4 倍(2026-09-11,3 条)
技术博主在阅读 DeepSeek 新模型(V4.1 Flash)技术报告时指出多个亮点:基准成绩高得惊人;相比 DSV4-Flash,KV Cache 缩小了 4 倍,这对推理显存占用与长上下文成本影响很大;此外训练过程也更加稳定。这些改进被认为对实际部署成本与效率有重要意义。
- 博主点评新模型技术报告:基准成绩惊人,KV 缓存缩小 4 倍 — stochasticchasm · 2026-09-11
- DeepSeek 新模型技术报告:KV Cache 较 DSV4-Flash 缩小 4 倍,训练更稳定 — stochasticchasm · 2026-09-11
- DeepSeek 或打破 V<N> 命名惯例,新架构自称训练更稳定 — stochasticchasm · 2026-09-11
第 12 集 · DeepSeek V4.1 Flash 登顶 Vals 开源榜,成本仅 0.3 美元(2026-09-11,2 条)
据 ValsAI 测评,DeepSeek V4.1 Flash 登顶 Vals Index 开源权重模型榜,超越 Kimi K3。每次测试成本仅 0.3 美元,是开源前十中最便宜的方案。有网友指出其价格约为 Kimi K3 与 GLM 5.3 的二十分之一,以极低成本登榜引发关注。
- DeepSeek V4.1 登顶 Vals 开源模型榜,每次测试仅 0.3 美元 — teortaxesTex · 2026-09-11
- 传 DeepSeek v4.1 flash 登顶 Vals 智能指数,成本仅竞品 1/20 — zainhas · 2026-09-11
第 13 集 · DeepSeek V4.1 Flash 评测得 40 分,幻觉率上升仍领先开源(2026-09-11,2 条)
Artificial Analysis 公布 DeepSeek V4.1 Flash 评测结果:AA 指数得 40 分,虽仍低于 GLM-5.3-Flash,但已超过最新的 DeepSeek V4 Pro。细分上,AA-Omniscience 提升 9 分至 -5.3,准确率从 40% 有所上升,不过幻觉率也有所上升,整体仍领先开源同侪。
- DeepSeek-V4.1-Flash 评测得 40 分,胜过 DeepSeek-V4-Pro — scaling01 · 2026-09-11
- DeepSeek V4.1 Flash 评测:幻觉率上升,成绩仍领先开源同侪 — ArtificialAnlys · 2026-09-11
第 14 集 · DeepSeek CED 与 GLM 的 KV 缓存复用机制解析(2026-09-11,4 条)
社区热议各家模型的 KV 缓存复用架构。YOCO(You Only Cache Once)设计简单:模型前半部分为普通结构,将隐藏状态再投影得到 K/V 后,后半段所有层共享同一份 KV 缓存。DeepSeek 的 CED 与 YOCO 思路类似,应用于 CSA2 层的全局分支,每层各自独立,且只缓存编码器 KV。GLM 5.2 则在保持灵活性的同时,将「按块打分」变为「按 token 打分」,块内共享 block index 以获得性能收益,各家命名与共享方式引发讨论。
- YOCO 架构拆解:模型后半段所有层共享同一份 KV 缓存 — stochasticchasm · 2026-09-11
- 拆解 DeepSeek CED:YOCO 式全局分支只缓存编码器 KV — stochasticchasm · 2026-09-11
- DeepSeek CED 与 GLM 的 KV 缓存复用到底差在哪?一条推文讲清架构细节 — stochasticchasm · 2026-09-11
- GLM 5.2 的 KV 缓存共享模式有何巧思 — stochasticchasm · 2026-09-11
第 15 集 · DeepSeek V4.1 Flash 技术深读:KV cache 压缩造就高效旗舰(2026-09-11,7 条)
@nrehiew 于 09-11 发布 DeepSeek V4.1 Flash 技术深读长线程,主线是「对 KV cache 压缩的偏执」如何造就一个超高效的旗舰级模型。系列覆盖多模态预训练、优化器与超参、训练基建、注意力 indexer、全局注意力与核心架构设计等多个层面。
已确认
- 多模态预训练:45T 图文 token 预训练,自研图像编码器(视觉部分采用 Siglip 风格编码器),并引入模态级 load balancing——这一点让作者联想到原始 Chameleon 的做法
- 优化器:采用 head-wise Muon,包含视觉模型;sparse attention 无需 warmup 从头训练;196B 参数 Engram 配 Sinkhorn 平衡
- 训练基建:视觉编码器的关键洞察是计算一个模态时可并行 all-gather 另一模态的特征;对超长多图序列应用 context parallelism
- 注意力 indexer:indexer 本身也是稀疏的——第一个 full mode indexer 先选出候选,后续层再用这些候选打分,形成分层筛选结构
- 全局注意力:本质是升级版压缩注意力,三种变体都先在小 KV 上跑 indexer 做选择,再与窗口化 KV 拼接后进入注意力;区别在于 KV 复用方式——不复用、复用早层 KV 等
- 核心架构:20 层 encoder + 20 层 decoder 的 YOCO 式 decoder-decoder 设计,针对 prefill 昂贵的问题,下半层生成 KV cache 后经逐层投影共享给上半层,可理解为一种将 KV cache 减半的手段
为什么重要
该系列系统性地展示了 KV cache 压缩贯穿模型设计各处——从架构、注意力机制到 indexer 结构——是理解这一高效旗舰模型工程取舍的完整技术参考。
- DeepSeek V4.1 Flash 技术深读:死磕 KV cache 压缩造就高效前沿模型 — nrehiew_ · 2026-09-11
- DeepSeek V4.1 Flash 多模态:45T 图文 token 预训练加模态级负载均衡 — nrehiew_ · 2026-09-11
- DeepSeek V4.1 Flash 用 YOCO 式 decoder-decoder 把 KV cache 减半 — nrehiew_ · 2026-09-11
- DeepSeek V4.1 Flash 的全局注意力:三种 KV 复用变体的压缩注意力 — nrehiew_ · 2026-09-11
- DeepSeek V4.1 Flash 稀疏 indexer 也是稀疏的,分层候选筛选 — nrehiew_ · 2026-09-11
- DeepSeek V4.1 Flash 用 Muon 优化器,196B 参数 Engram 配 Sinkhorn 平衡 — nrehiew_ · 2026-09-11
- DeepSeek V4.1 Flash 基建细节:Siglip 式视觉编码器与稀疏 indexer 集群 — nrehiew_ · 2026-09-11