专题 · FULL STORY

K2 Horizon 全开源发布:从亮相到评测

MBZUAI 以「前沿性能,彻底开源」为口号发布 K2 Horizon 模型家族,涵盖 0.9B 至数百参数规模的多款模型,随后 Artificial Analysis 评测显示其幻觉率仅 26%、agent 任务表现领先。

2026-09-03 ~ 2026-09-03 · 2 集 · 12 条

第 1 集 · MBZUAI 开源 K2 Horizon 全家族,号称史上最大全开源发布(2026-09-03,8 条)

9 月 3 日,阿联酋 MBZUAI 基础模型研究所(IFM)发布 K2 Horizon 模型家族,以「前沿性能,彻底开源」为口号,包含六款参数规模从 0.9B 到 375B 的模型。旗舰 K2-Horizon-375B(MoE,A23B)在 Artificial Analysis Intelligence Index 上取得 47 分,据 Artificial Analysis 的评测,比前代 K2 Think V2 高出约 30 分。由于开源程度之高——从权重到训练代码、数据配方一应俱全——这一发布被多个帖子作者称为「AI 史上最大的完全开源发布」。

已确认

  • K2 Horizon 家族共六款模型,参数覆盖 0.9B 至 375B,旗舰为 MoE 架构的 K2-Horizon-375B A23B,已在 Hugging Face 发布。
  • 开源内容不限于权重:训练代码、训练数据构建配方、中间 checkpoint、细粒度训练日志与评测结果全部公开,@testingcatalog 评价其透明度罕见地高。
  • 官方称系列在编程与 agentic 任务上各尺寸级别均达顶级水平,0.9B、3.7B 和 7B 版本在各自规模刷新 SOTA。
  • 旗舰模型在 Artificial Analysis Intelligence Index 得分 47,较前代 K2 Think V2 提升约 30 分。
  • vLLM 项目宣布对 K2-Horizon 提供 day-0 支持,转发信息还提到系列支持 512K 上下文。

尚未确认

  • 官方 SOTA 与性能表述主要来自发布方与转发帖,独立评测结果尚未在帖子材料中出现。

为什么重要

多个帖子作者将此次发布称为「AI 史上最大的完全开源发布」——不仅放出模型权重,还公开了从训练代码到数据配方的完整链路。若社区基于这些材料成功复现或继续训练,将显著降低前沿模型研究的门槛,也为开源生态提供了一个透明度的新标杆;vLLM 的 day-0 支持也降低了部署门槛。

第 2 集 · K2 Horizon 评测细节公布:幻觉率仅 26%,agent 任务领先(2026-09-03,4 条)

Artificial Analysis 公布 K2 Horizon 375B A23B 的 Intelligence Index 各单项评测明细。该模型只尝试回答 40% 的 AA-Omniscience 问题,其余选择拒答而非乱猜,幻觉率降至 26%。在同等智能水平的 agent 任务中表现突出,GDPval-AA Elo 达 1430,超过 MiniMax-M3 领跑同类模型。