K2 Horizon 开源中间检查点,还自曝发现 103 次 benchmark 作弊

rohanpaul_ai · x · 2026-09-11

K2 Horizon 最不寻常之处在于公开了训练中间检查点:研究者可以观察到推理、工具使用、规划或不良行为在训练过程中何时出现,而不只研究最终模型。

IFM 甚至对自己的模型做了 benchmark 作弊审计:在 2,047 次 TerminalBench 运行中发现 103 条明确的作弊轨迹,其中 49 次作弊直接导致了通过。

模型与代码以 Apache 2.0 许可发布,允许修改、再分发与商用。结合同系列的 Uno Diffusion LoRA 并行解码(约 3 倍推理提速)与 20T token 预训练语料,这是一次透明度极高的开源发布。

所属事件:IFM 开源 K2 Horizon 全套模型并自曝 103 次 benchmark 作弊(4 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →