专题 · FULL STORY

蚂蚁Ling-3.0-flash:从发布到开源

蚂蚁集团inclusionAI发布面向生产级智能体的124B参数混合推理MoE模型Ling-3.0-flash,随后按MIT协议正式开源,推动智能体生态发展。

2026-07-24 ~ 2026-08-04 · 4 集 · 18 条

第 1 集 · 蚂蚁推出124B参数MoE模型Ling-3.0-flash(2026-07-24,12 条)

蚂蚁集团 inclusionAI 正式发布 Ling-3.0-flash 模型,主打面向生产级 Agent 的混合推理能力。该模型现已登陆 OpenRouter 与 Nous Portal 平台,其中 OpenRouter 的免费使用期延续到 2026 年 8 月 3 日,Nous Portal 提供一周免费,其开放权重也已得到确认。

已确认

多方信息显示,Ling-3.0-flash 是一款混合推理稀疏 MoE 模型。其总参数量达到 124B,但在运算时每个 token 仅激活 5.1B 参数,支持高达 256K 的上下文长度,并宣称首 token 延迟低于 1 秒。该模型特别针对编程与智能体场景进行了优化。据作者 @FellMentKE 透露,它具备自我纠错能力,能在代码报错时读取信息并自行修正,从而减少开发者的调试时间。

平台部署方面,Nous Portal 宣布提供为期一周的免费使用,而 OpenRouter 的免费期限更是直接延续到 2026 年 8 月 3 日。此外,据 @victormustar 确认,该模型的开放权重(open weights)也已在计划之中。

为什么重要

极高的参数总量配合极低的激活参数,意味着该模型在保障强大推理能力的同时,能大幅降低运行成本和延迟。这种特性使其非常适合对响应速度和成本敏感的生产级智能体场景,而长达数年的免费期以及即将到来的开放权重,为开发者提供了极大的便利与充足的测试应用空间。

第 2 集 · 蚂蚁集团发布 Ling-3.0-flash 混合推理模型(2026-07-27,2 条)

蚂蚁集团模型团队正式发布了 Ling-3.0-flash,这是一款专为生产级智能体设计的混合推理 MoE 模型。该模型总参数量达到 124B,但每个 token 仅激活 5.1B 参数,兼顾了强大的性能与运行效率。此外,官方宣布该模型的 API 将免费开放使用至 8 月 3 日,方便开发者快速接入与测试。

第 3 集 · 蚂蚁百灵发布 Ling-3.0-flash 混合推理模型(2026-07-29,2 条)

蚂蚁百灵(AntLingAGI)发布了全新的原生混合推理 MoE 模型 Ling-3.0-flash,专为生产级智能体设计。该模型总参数量达 124B,但每个 token 仅激活 5.1B 参数(约 1/12)。凭借极高的参数效率,其性能足以媲美万亿级旗舰模型。

第 4 集 · Ling-3.0-flash混合架构MoE模型开源(2026-08-04,2 条)

inclusionAI与AntLingAGI团队在Hugging Face开源了新一代原生混合推理模型Ling-3.0-flash。该模型采用MIT协议,总参数量约124B至127B,基于混合线性MoE架构设计。其官方FP8版本极大降低了部署门槛,仅需128GB显存即可运行。