MBZUAI 开源 K2 Horizon 375B 模型,智能指数比前代暴涨 30 分
ArtificialAnlys · x · 2026-09-03
阿联酋 MBZUAI 基础模型研究所发布开源权重 MoE 模型 K2 Horizon 375B A23B,在 Artificial Analysis Intelligence Index 得分 47,比前代 K2 Think V2(70B 稠密,17 分)提升 30 分,与 MiniMax-M3(45)相近。
- 架构:375B 总参数 / 23B 激活的 MoE,上下文从 262K 扩至 512K tokens,纯文本输入输出;定价与开源许可细节待公布。
- Agent 能力强,知识与深度推理偏弱:GDPval-AA Elo 1430 领先同档 MiniMax-M3(1380),τ³-Banking 达 34.2%(对手 15.3%);但 GPQA Diamond(87.3% vs 92.9%)和 Humanity's Last Exam(32.0% vs 39.0%)落后。
- 超低幻觉率:模型倾向拒答而非乱猜,仅尝试 40% 的 AA-Omniscience 问题,幻觉率 26%,为已测最低之一;准确率 18% 与前代持平,但前代幻觉率高达 71%。
- 前代 K2 Think V2 曾在开放度指数名列前茅,K2 Horizon 的文档与代码更新后有望同样上榜。
所属事件:MBZUAI 全开源发布 K2 Horizon 模型家族(5 条相关)→
「模型」频道最新
- 第三方实测 Meta Muse Spark 1.3:安全基准 19/32,仍不敌中国前沿模型 — teortaxesTex · 2026-09-03
- DeepMind 发布 WeatherNext 3:实时观测直接学习的天气预报突破 — GoogleDeepMind · 2026-09-03
- 排查半天以为被封号,原来 ChatGPT 全球服务宕机 — vista8 · 2026-09-03
- ChatGPT、Claude、Grok 三大模型同时宕机,实属罕见 — joshgans · 2026-09-03
- Gemini 3.8 Flash 实测跑出每秒 3000 tokens 的推理速度 — xennygrimmato_ · 2026-09-03
- Grok 机器人更新至 0.36.0 版本,官方称修复大量 Bug — mark_k · 2026-09-03