专题 · FULL STORY
DeepSeek V4.1-Flash:发布与实测降本
DeepSeek 官宣新架构家族中最小的模型 V4.1-Flash,552B MoE 支持百万上下文与原生视觉,面向长程 Agent 工作负载。随后开发者大规模实测,称用其替代原有方案后砍掉九成 AI 开销,DeepSeek 成为工作流主力。
2026-09-18 ~ 2026-09-19 · 2 集 · 6 条
第 1 集 · 开发者实测后砍九成AI开销 DeepSeek成主力(2026-09-18,2 条)
开发者 @btsouth 在 agent 工作流中大量实测 DeepSeek V4.1 Flash,先在 4 天内用掉超 20 亿 tokens,随后称总投入已超 70 亿。他认为该模型不是“预算备胎”,而是可承担编码、调试等任务的默认主力,并把月费从约 300 美元降到 30 美元,AI 开销下降约九成。
- 跑完 20 亿 tokens 后他砍掉九成 AI 开销:月费从 $300 降到 $30 — gaganghotra_ · 2026-09-18
- 开发者烧 70 亿 tokens 实测:DeepSeek V4. Flash 成主力工作马 — gaganghotra_ · 2026-09-19
第 2 集 · DeepSeek 发布 V4.1-Flash,552B MoE 支持百万上下文(2026-09-18,4 条)
DeepSeek 官宣 V4.1-Flash,这是新架构家族中最小的模型,具备原生视觉理解能力,面向长程 Agent 工作负载,并为家族后续更大模型铺路。模型为 552B 参数的多模态 MoE,仅激活约 8B 参数,上下文最高 100 万 token,KV 缓存压缩至 890 字节/Token。模型已上线 Inco 与 Nebius Token Factory,在 Inco 上输出速度达 532 tokens/s,居平台速度榜第一。
- DeepSeek V4.1 Flash 上线 Nebius:552B MoE 仅激活 8B,配 1M 上下文 — Arindam_1729 · 2026-09-18
- DeepSeek 发布 V4.1-Flash:新架构家族最小模型,原生视觉理解 — aziz4ai · 2026-09-18
- DeepSeek V4.1 Flash 上线 Inco,532 tokens/s 居速度榜第一 — songhan_mit · 2026-09-18
- DeepSeek 发布 V4.1-Flash:KV 压缩至 890 字节/Token,支持百万上下文 — deepseek-ai · 2026-09-18