蚂蚁 Ling-3.0-flash-VL 发布:124B 稀疏 MoE 仅激活 5.5B,支持 1M 上下文
jacek2023 · reddit · 2026-09-08
inclusionAI 在 Hugging Face 开源多模态模型 Ling-3.0-flash-VL:
- 总参数 124B 的稀疏 MoE 架构,每 token 仅激活 5.5B,兼顾多模态能力与推理效率;
- 继承 Ling-3.0-flash 的语言、推理与长上下文能力,原生支持图像与视频理解,上下文最长 1M token;
- 技术要点:ViT 视觉编码器 + 两层 MLP 对齐;VideoRoPE 同时编码空间位置与时序,支持事件定位、长视频问答与剪辑;42 层混合主干按 5:1 交替 KDA 与 Gated MLA 层,高效处理文本/图像/视频与长 agent 任务历史;
- 定位是把视觉信息融入真实世界推理与 agent 工作流。
「模型」频道最新
- Blender 同题实测:两旗舰模型输出差距悬殊,训练数据分布是主因 — ZeroStateReflex · 2026-09-09
- Netlify 上线 GPT-6 Astra 等 3 款新模型,Agent Runner 智能改配额用法 — thisiskp_ · 2026-09-09
- GLM-5.3-Flash 登顶智能体工具调用榜首,输出仅 $0.50/百万 token — shensi · 2026-09-09
- Artificial Analysis 四天两次调榜,Astra 真实实力获认可 — py-net · 2026-09-09
- Gary Marcus 断言:真正的能力在 harness 而非模型,企业 beware 黑箱 — GaryMarcus · 2026-09-09
- Inception 发布 Mercury 2.5:最强扩散 LLM,1107 tokens/秒、26 万上下文 — StefanoErmon · 2026-09-09