DeepSeek 开源 V4 首款多模态模型,主打 Agent 视觉能力

APPSO · wechat · 2026-08-31

DeepSeek 正式开源 V4 家族首款实验性多模态模型 DeepSeek-V4-Flash-Vision-Exp,采用 MIT 协议。该模型基于 DeepSeek-V4-Flash 架构加入视觉模块,在保留文本、推理和 Agent 能力的同时获得了图像理解能力。开源内容包括模型文件、Tokenizer 及最小化 PyTorch 推理实现。

官方定位偏向 Agent,强调多模态 Agent 能力,使其能读取网页截图、软件界面等视觉信息并调用工具。评测数据显示,视觉能力加入后,TerminalBench 2.1 得分提升至 83.9,DeepSWE 提升至 59.3,均优于 Opus-4.8;多模态 Agent 测试中 ApexBench Pass@1 达 36.5,同样超越对比模型。

所属事件:DeepSeek 悄然开源 V4 首款多模态模型 Vision-Exp(12 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →