DeepSeek 悄然开源 V4 首款多模态模型 Vision-Exp
8 月 31 日,DeepSeek 在 Hugging Face 上悄然发布并开源了 V4 系列的首个实验性多模态模型 DeepSeek-V4-Flash-Vision-Exp。该模型基于 DeepSeek-V4-Flash 架构,通过引入视觉模块并持续训练获得视觉理解能力,采用 MIT 协议开源并提供多种精度版本,标志着 DeepSeek 正式进入多模态赛道。
已确认
- 模型由 @deepseek-ai 官方发布,现已在 Hugging Face 上线(@NielsRogge、@victormustar、@ricklamers、@multimodalart、@AdinaYakup 等多条帖子交叉确认)。该模型由 Reddit 用户率先发现,发布初期尚无官方公告与详细说明(@t4a8945)。
- 基于 DeepSeek-V4-Flash 架构,通过引入视觉模块和持续训练获得视觉理解能力,是 V4 系列首款多模态模型(@赛博禅心、@APPSO)。
- 采用 MIT 协议开源,提供 8-bit 和 fp8 精度版本,兼容 Transformers 架构,支持 safetensors 格式(@NielsRogge、@victormustar、@deepseek-ai)。
- 模型 pipelinetag 为 image-text-to-text,支持视觉与文本输入并专注文本生成任务(@AdinaYakup、@victormustar)。@zainhas 补充称这是一个 500B 以下、支持图像输入的视觉语言实验模型,模型卡上的视觉编码评测表现亮眼。
- 据 @APPSO 介绍,模型在保留文本、推理和 Agent 能力的基础上主打 Agent 视觉能力;据 @maxpaperclips 转述,其文本能力与 V4-Flash 持平,多模态 Agent 基准性能接近 Opus-4.8,并可通过 API 使用。
为什么重要
- 这是 DeepSeek V4 系列向多模态扩展的第一步,此前该系列仅有纯文本模型。
- @teortaxesTex 认为,此次更新使 DeepSeek 在功能上与 Moonshot(Kimi)和 GLM 达到同等水平,意味着国产头部开源模型在多模态能力上的竞争进一步拉近。
- 以 MIT 协议开放权重并提供多种精度版本,降低了开发者的部署与微调门槛。
2026-08-31 ~ 2026-08-31 · 12 条相关
- 第 1 集:DeepSeek 上线 V4-Flash-Vision-Exp 多模态模型(2026-08-21,29 条)
- 第 2 集:DeepSeek V4 Flash Vision 实测亮眼获开发者好评(2026-08-23,4 条)
- 第 3 集:DeepSeek 悄然开源 V4 首款多模态模型 Vision-Exp(2026-08-31,12 条)
一手来源
- DeepSeek 发布 V4-Flash-Vision-Exp 多模态模型 — deepseek-ai ·
- DeepSeek-V4 Flash 视觉模型上线 Hugging Face — NielsRogge ·
- DeepSeek开源V4系列首款多模态模型FlashVision — 赛博禅心 ·
- 【源头】DeepSeek 发布 V4-Flash-Vision-Exp 多模态模型 — deepseek-ai · 2026-08-31
- DeepSeek 悄然上线 V4-Flash-Vision-Exp 实验模型 — t4a8945 · 2026-08-31
- DeepSeek 发布 Vision-Exp 权重 — teortaxesTex · 2026-08-31
- 【源头】DeepSeek开源V4系列首款多模态模型FlashVision — 赛博禅心 · 2026-08-31
- 【源头】DeepSeek-V4 Flash 视觉模型上线 Hugging Face — NielsRogge · 2026-08-31
- DeepSeek 开源多模态模型 V4-Flash-Vision-Exp — max_paperclips · 2026-08-31
- DeepSeek V4 Flash Vision Exp 上线 HF — AdinaYakup · 2026-08-31
另有 5 条近重复转述:victormustar · APPSO · ricklamers · multimodalart · zainhas