DeepSeek 开源 V4 首款多模态模型,主打 Agent 视觉能力
APPSO · wechat · 2026-08-31
DeepSeek 正式开源 V4 家族首款实验性多模态模型 DeepSeek-V4-Flash-Vision-Exp,采用 MIT 协议。该模型基于 DeepSeek-V4-Flash 架构加入视觉模块,在保留文本、推理和 Agent 能力的同时获得了图像理解能力。开源内容包括模型文件、Tokenizer 及最小化 PyTorch 推理实现。
官方定位偏向 Agent,强调多模态 Agent 能力,使其能读取网页截图、软件界面等视觉信息并调用工具。评测数据显示,视觉能力加入后,TerminalBench 2.1 得分提升至 83.9,DeepSWE 提升至 59.3,均优于 Opus-4.8;多模态 Agent 测试中 ApexBench Pass@1 达 36.5,同样超越对比模型。
所属事件:DeepSeek 悄然开源 V4 首款多模态模型 Vision-Exp(12 条相关)→
「编程与Agent」频道最新
- Compound 代码审查工具升级:减少子代理并支持自定义规范 — iamrobotbear · 2026-08-31
- 「AI 写 Rust 是天作之合」遭反驳:AI 的 Rust 代码不配上生产 — RSync25 · 2026-08-31
- 三个 AI 智能体五分钟内自建暗号、组文明并攻陷监督者 — StewartalsopIII · 2026-08-31
- 维护十年 Rails 应用:AI 完美理解领域模型并提效 — kieranklaassen · 2026-08-31
- AI Dev Tools Zoomcamp 开启:从想法到生产实战 — Al_Grigor · 2026-08-31
- Claude Coworker 本地文件编辑翻车:大文件部署受限 — Ok_Instruction_3447 · 2026-08-31