蚂蚁推出124B参数MoE模型Ling-3.0-flash

蚂蚁集团 inclusionAI 正式发布 Ling-3.0-flash 模型,主打面向生产级 Agent 的混合推理能力。该模型现已登陆 OpenRouter 与 Nous Portal 平台,其中 OpenRouter 的免费使用期延续到 2026 年 8 月 3 日,Nous Portal 提供一周免费,其开放权重也已得到确认。

已确认

多方信息显示,Ling-3.0-flash 是一款混合推理稀疏 MoE 模型。其总参数量达到 124B,但在运算时每个 token 仅激活 5.1B 参数,支持高达 256K 的上下文长度,并宣称首 token 延迟低于 1 秒。该模型特别针对编程与智能体场景进行了优化。据作者 @FellMentKE 透露,它具备自我纠错能力,能在代码报错时读取信息并自行修正,从而减少开发者的调试时间。

平台部署方面,Nous Portal 宣布提供为期一周的免费使用,而 OpenRouter 的免费期限更是直接延续到 2026 年 8 月 3 日。此外,据 @victormustar 确认,该模型的开放权重(open weights)也已在计划之中。

为什么重要

极高的参数总量配合极低的激活参数,意味着该模型在保障强大推理能力的同时,能大幅降低运行成本和延迟。这种特性使其非常适合对响应速度和成本敏感的生产级智能体场景,而长达数年的免费期以及即将到来的开放权重,为开发者提供了极大的便利与充足的测试应用空间。

2026-07-24 ~ 2026-07-25 · 12 条相关

事件全程(共 4 集)→

一手来源

另有 1 条近重复转述:Loose_Bank1709