Cohere 发布 Tiny Aya Vision:不到 4B 参数支持 70+ 语言

Cohere_Labs · x · 2026-08-24

Cohere Labs 社区研究员发布 Tiny Aya Vision,一个亚 4B 参数的多语言视觉语言模型(VLM),支持 70+ 语言,为该规模首创。它在 3.35B、70+ 语言的 Tiny Aya 基础上,通过参数高效融合加入轻量视觉能力。

核心问题是:3B 的多语言模型能否在不牺牲多语言文本性能与端侧可部署性的前提下获得有效视觉 grounding。现有亚 4B 模型中没有一个同时具备视觉能力与 70+ 语言支持(对比 Qwen3-VL-2B、Gemma 3-1B、SmolVLM 等)。

方法上采用冻结视觉编码器 + 小型连接器 + LoRA,再将权重合并回主模型以恢复文本性能。此前 Aya Vision 8B 上这一合并步骤把 AyaVisionBench 多语言视觉胜率从 58.1% 提到 70.0%;此次要验证同样收益是否在 3.35B 规模出现。代码已开源,结果为进行中的 v0 模型。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →