Cohere 发布 Tiny Aya Vision:不到 4B 参数支持 70+ 语言
Cohere_Labs · x · 2026-08-24
Cohere Labs 社区研究员发布 Tiny Aya Vision,一个亚 4B 参数的多语言视觉语言模型(VLM),支持 70+ 语言,为该规模首创。它在 3.35B、70+ 语言的 Tiny Aya 基础上,通过参数高效融合加入轻量视觉能力。
核心问题是:3B 的多语言模型能否在不牺牲多语言文本性能与端侧可部署性的前提下获得有效视觉 grounding。现有亚 4B 模型中没有一个同时具备视觉能力与 70+ 语言支持(对比 Qwen3-VL-2B、Gemma 3-1B、SmolVLM 等)。
方法上采用冻结视觉编码器 + 小型连接器 + LoRA,再将权重合并回主模型以恢复文本性能。此前 Aya Vision 8B 上这一合并步骤把 AyaVisionBench 多语言视觉胜率从 58.1% 提到 70.0%;此次要验证同样收益是否在 3.35B 规模出现。代码已开源,结果为进行中的 v0 模型。
「多模态」频道最新
- Flux1 图生 WAN2.2 短片后,如何拼成15秒以上长视频 — wreck_of_u · 2026-08-24
- ComfyUI 蓝色运行按钮意外执行全分支的排查 — ImaginaryIncident481 · 2026-08-24
- MiniMax M3 一键生成 Logo 品牌片,无需动效设计技能 — petewoodbridge · 2026-08-24
- InfinityEdit:用轻量级适配器实现无限流视频编辑 — _akhaliq · 2026-08-24
- 阿里 Wan3.0 支持 30 秒 AI 视频,1080p 售 6 美元 — The Decoder · 2026-08-24
- Seedance 2.5 生成视频:真实到让人忘记这是 AI 生成 — Aiden_Tech_Ai · 2026-08-24