Ling 3.0-flash-VL 支持合入 llama.cpp:124B 参数仅激活 5.5B
jacek2023 · reddit · 2026-09-24
- inclusionAI 的 Ling-3.0-flash-VL 已有 PR 合入 llama.cpp(#29151),继承 Ling-3.0-flash 的语言、推理与长上下文能力,并新增原生图像与视频理解。
- 关键规格:总参数 124B,每 token 仅激活 5.5B,上下文窗口最高 256K tokens。
- 架构亮点:
- ViT 视觉编码器 + 两层 MLP 投影器,对齐视觉与文本表征;
- VideoRoPE 同时编码空间位置与时间顺序,支持事件定位、长视频问答、视频片段编辑;
- 42 层混合骨干按 5:1 交替 KDA 与 Gated MLA 层,高效处理文本/图像/视频/长 agent 任务历史;
- 稀疏 MoE 在保持 124B 容量的同时大幅降低推理成本。
「Infra」频道最新
- 40万向量从 Milvus 迁到 Qdrant:延迟吞吐内存全对比 — qdrant_engine · 2026-09-24
- Brookings:2025-2032 年 AI 算力投资将达 10.3 万亿美元 — rohanpaul_ai · 2026-09-24
- 研究:超大规模厂商需 2.7 倍生产力增长才能撑起 1.1 万亿美元算力投入 — Post-reality · 2026-09-24
- 面向科学 AI 的类 Modal 运行时 HSIR 发布,DAX 基准 55.8 秒领先多家 — retr0jirachi · 2026-09-24
- Cloudflare 用数学+Rust 省下 100TB 内存 — bibryam · 2026-09-24
- Intel Arc B580 跑通 INT8 加速,Flux 2 Klein 9B 出图仅 3.9 秒 — Valuable-Subject-274 · 2026-09-24