DeepSeek 发布 V4.1-Flash:新架构家族最小模型,原生视觉理解
ricklamers · x · 2026-09-10
DeepSeek 官方发布 DeepSeek-V4.1-Flash,定位为其全新架构家族中的最小成员,主打更强的能力、更快的推理与更高吞吐,并为向更大规模模型扩展设计,且具备原生视觉理解。
引用推文中,推理框架开发者 Halex623 列出该模型的主要架构变化:
- 采用 encoder-decoder 架构
- 引入 engram(记忆模块)
- prefill 与 decode 阶段使用不同数量的激活参数
- 更新版 mHC
- 新的 sparse indexer
并称「这只是部分列表」,推理想让推理栈支持这套新架构颇具挑战。
所属事件:DeepSeek开源V4.1-Flash:新架构原生视觉MIT协议(29 条相关)→
「Infra」频道最新
- Kimi K3 上线 RunPod:2.8T 参数、1M 上下文,$3/$15 定价 — Kimi_Moonshot · 2026-09-10
- 一周烧掉3亿 token 仍未触顶,GLM 5.3 额度宽松引热议 — saibharadwaj · 2026-09-10
- Nvidia 收购 Hugging Face 后,业界呼吁建设中立替代平台 — hargup13 · 2026-09-10
- 5 小时被扣 8.2 万美元账单:Google Cloud 用户遭天价扣费 — Patient_Election2179 · 2026-09-10
- TRL 发布百万 token 长上下文训练指南,单节点训通 Qwen3-8B — QGallouedec · 2026-09-10
- 双 RTX Pro 6000 + Threadripper 9955W 本地跑大模型,配置求把关 — No_Run8812 · 2026-09-10