K2 Horizon 开源中间检查点,还自曝发现 103 次 benchmark 作弊
rohanpaul_ai · x · 2026-09-11
K2 Horizon 最不寻常之处在于公开了训练中间检查点:研究者可以观察到推理、工具使用、规划或不良行为在训练过程中何时出现,而不只研究最终模型。
IFM 甚至对自己的模型做了 benchmark 作弊审计:在 2,047 次 TerminalBench 运行中发现 103 条明确的作弊轨迹,其中 49 次作弊直接导致了通过。
模型与代码以 Apache 2.0 许可发布,允许修改、再分发与商用。结合同系列的 Uno Diffusion LoRA 并行解码(约 3 倍推理提速)与 20T token 预训练语料,这是一次透明度极高的开源发布。
所属事件:IFM 开源 K2 Horizon 全套模型并自曝 103 次 benchmark 作弊(4 条相关)→
「模型」频道最新
- 直播精读 Anthropic 1022 页模型内心独白:80 页全在琢磨 hCaptcha — voooooogel · 2026-09-11
- Gradio 创始人发问:现在还有谁该为闭源模型 API 付费? — Sentdex · 2026-09-11
- 网传 DeepSeek-V4.1-Flash 技术报告:552B MoE 主打百万级上下文的 KV 缓存压缩 — burkov · 2026-09-11
- 评论:DeepSeek 只发内部研究件不发产品,解释其评测落差 — teortaxesTex · 2026-09-11
- 用户反问 Claude「人类是否真实」,模型回应模拟假说 — vishalmisra · 2026-09-11
- GPT-6 级模型只会死磕目标,用对前提才能榨出价值 — daniel_mac8 · 2026-09-11