仅花2000美元,开发者成功为DeepSeek V4外挂视觉能力
ButtercupLyn100 · reddit · 2026-08-11
一位开发者尝试在不改动大模型主体的前提下,为纯文本 MoE 模型 DeepSeek V4 Flash 添加视觉能力。
实验设计:
- 冻结 284B 参数的 DeepSeek V4 Flash 和 417M 参数的 MoonViT 图像编码器。
- 仅训练两者间一个 40.1M 参数的连接器(MLP)。
- 从 The Cauldron 数据集中抽取 10 万个图文样本进行 1 个 Epoch 的训练。
训练与开销:
- 使用 5 张 H200 GPU,有效吞吐约 4,938 样本/小时。
- 包含数据准备、转换和推理验证在内,端到端项目总花费约 2000 美元。
效果验证:
- 模型已具备基础视觉理解能力,能识别街景中的人物和标志,并在浏览器截图中准确定位 UI 控件。
- 虽然目前仅为实验性质,但成功验证了「冻结大模型+训练轻量连接器」的低成本多模态改造路线的可行性。
「模型」频道最新
- 本地开源模型实现代码自检运行,订阅价值何在? — truecakesnake · 2026-08-11
- OpenAI 模型被指过度压制创造力,用户呼吁开放温度调节 — RileyRalmuto · 2026-08-11
- GLM-5.2 定价极具竞争力,智能成本正急剧下降 — tobowers · 2026-08-11
- 开发者盛赞 Kimi K3:宛如真实版 Llama 4 Behemoth — willccbb · 2026-08-11
- 阿里官方确认:Qwen3.8-27B 开源权重本周发布 — max_paperclips · 2026-08-11
- Abacus AI 发布 Smaug-Agentic:登顶开源智能体编码榜首 — bindureddy · 2026-08-11