蚂蚁 Ling-3.0-flash-VL 评测:5.5B 激活参数上帕累托前沿,幻觉率仅 22%
ArtificialAnlys · x · 2026-09-12
蚂蚁集团发布开源权重推理模型 Ling-3.0-flash-VL,在 Ling-3.0-flash 基础上加入图像与视频理解。Artificial Analysis 评测要点:
- MoE 架构,总参数 124B,每 token 仅激活 5.5B,256K 上下文,支持文本/图像/视频输入,MIT 许可
- 在 AA 智能指数得 25 分,处于智能 vs 激活参数的帕累托前沿;同量级对比 Qwen3.5 122B A10B 得 16、Mistral Medium 3.5 得 15
- 幻觉率较低:AA-Omniscience 准确率 14%、幻觉率 22%;Inkling Small 准确率 33% 但幻觉率高达 63%,事实召回偏弱
- 复杂 Agent 任务仍有短板:AutomationBench-AA 得 16%,Terminal-Bench v4.0 得 0%
- 输出偏冗长,每任务平均约 5 万输出 token(Inkling Small 约 3 万),高推理量场景成本会受影响
所属事件:蚂蚁开源 Ling-3.0-flash-VL,小激活参数登顶开源多模态评测(2 条相关)→
「模型」频道最新
- 网友析 DeepSeek 迭代哲学:每代只攻上一代最关键的瓶颈 — xennygrimmato_ · 2026-09-12
- 1700 个任务做 RL,Kimi K2.7 五项编码评测全线大涨 — echen · 2026-09-12
- 网友体感:fable 5.1「像个活物」,astra 像无魂超能机器人 — rudrank · 2026-09-12
- 用户曝 Astra xhigh 存在无限用量漏洞,不计入任何用量统计 — Intelligent-Dance361 · 2026-09-12
- DeepSeek v4.1-Flash 登陆 Modal:输入激活 16B 输出 8B 省成本 — charles_irl · 2026-09-12
- Devin Fusion 登上编码智能体榜:61.7 分仅差 Claude Code 4%,成本省 36% — ArtificialAnlys · 2026-09-12