DeepSeek 开源 V4-Flash-Vision-Exp:给 Agent 装上“眼睛”

大模型之路 · wechat · 2026-09-02

DeepSeek 在 HuggingFace 上线 V4 家族首款实验性多模态模型 DeepSeek-V4-Flash-Vision-Exp,总参数 305B、激活参数仅 13B,采用 MIT 许可开源。它的定位不是“看图问答”,而是给 Agent 接上视觉感知:直接读网页截图、软件界面,再结合工具调用完成任务。

能力方面,官方称多模态 Agent 能力接近 Claude Opus 4.8:加上视觉几乎没拖慢纯文本表现,TerminalBench 2.1 从 82.7 涨到 83.9,DeepSWE 从 54.4 升到 59.3;Agents' LastExam 27.3 超过 Opus 4.8 的 25.7。社区已有 7 个面向 llama.cpp、Ollama、LMStudio 的量化版本,也可直接调 DeepSeek API 体验,先 API 验证场景、再本地私有化是更稳的路径。

作者同时提醒边界:305B 体量适合服务端而非端侧,复杂界面的细粒度定位与长流程状态保持仍易翻车;实验版跑分依赖特定评测配置,建议用自己业务的真实截图内测。文章认为这代表行业从“谁聊天更聪明”转向“谁看懂界面并替你完成任务”,是纯文本 Agent 缺失的感知一环。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →