DeepSeek V4.1-Flash:KV缓存缩至首代1/437,价格仅为Opus四十分之一
AdinaYakup · x · 2026-09-10
对 DeepSeek V4.1 Flash 的分析显示其规格惊人:
- 非对称因果编码器-解码器架构:550B MoE,输入激活 8B / 输出 16B
- 原生视觉能力合并到同一端点
- KV 缓存大幅压缩:HBM 占用约为上一代 1/4,比其第一代模型小 437 倍
- 价格:错峰输出 $0.6/M token,比旗舰 Flash 模型便宜 6 倍,约为 Claude Opus 4.8 和 GPT-5.6 的 1/40
- 这个「Flash」型号甚至击败了自家旗舰 V4 Pro
模型已在 Hugging Face 开放(MIT 许可,401 赞)。
所属事件:DeepSeek V4.1 曝 552B 非对称激活架构(15 条相关)→
「Infra」频道最新
- Kimi K3 上线 RunPod:2.8T 参数、1M 上下文,$3/$15 定价 — Kimi_Moonshot · 2026-09-10
- 一周烧掉3亿 token 仍未触顶,GLM 5.3 额度宽松引热议 — saibharadwaj · 2026-09-10
- Nvidia 收购 Hugging Face 后,业界呼吁建设中立替代平台 — hargup13 · 2026-09-10
- 5 小时被扣 8.2 万美元账单:Google Cloud 用户遭天价扣费 — Patient_Election2179 · 2026-09-10
- TRL 发布百万 token 长上下文训练指南,单节点训通 Qwen3-8B — QGallouedec · 2026-09-10
- 双 RTX Pro 6000 + Threadripper 9955W 本地跑大模型,配置求把关 — No_Run8812 · 2026-09-10