专题 · FULL STORY

DeepSeek V4.1-Flash:发布与实测降本

DeepSeek 官宣新架构家族中最小的模型 V4.1-Flash,552B MoE 支持百万上下文与原生视觉,面向长程 Agent 工作负载。随后开发者大规模实测,称用其替代原有方案后砍掉九成 AI 开销,DeepSeek 成为工作流主力。

2026-09-18 ~ 2026-09-19 · 2 集 · 6 条

第 1 集 · 开发者实测后砍九成AI开销 DeepSeek成主力(2026-09-18,2 条)

开发者 @btsouth 在 agent 工作流中大量实测 DeepSeek V4.1 Flash,先在 4 天内用掉超 20 亿 tokens,随后称总投入已超 70 亿。他认为该模型不是“预算备胎”,而是可承担编码、调试等任务的默认主力,并把月费从约 300 美元降到 30 美元,AI 开销下降约九成。

第 2 集 · DeepSeek 发布 V4.1-Flash,552B MoE 支持百万上下文(2026-09-18,4 条)

DeepSeek 官宣 V4.1-Flash,这是新架构家族中最小的模型,具备原生视觉理解能力,面向长程 Agent 工作负载,并为家族后续更大模型铺路。模型为 552B 参数的多模态 MoE,仅激活约 8B 参数,上下文最高 100 万 token,KV 缓存压缩至 890 字节/Token。模型已上线 Inco 与 Nebius Token Factory,在 Inco 上输出速度达 532 tokens/s,居平台速度榜第一。