IFM 开源 K2 Horizon 六款模型,0.9B 到 375B 全套训练过程公开
rohanpaul_ai · x · 2026-09-11
Institute of Foundation Models(IFM)发布 K2 Horizon:6 个开源模型,从 0.9B 到 375B,覆盖端侧小模型到推理、编码与 Agent 大模型。
- 全开源:每个模型都放出权重、训练代码、配置、数据或数据配方、中间 checkpoint、训练日志与评测,覆盖从预训练到推理和 Agent 训练全流程
- 成绩:0.9B/3.7B/7B 在各自尺寸段刷新 SOTA;稀疏 36B-A4B 每token仅激活约 4B 参数,性能接近稠密 32B
- 架构:采用新 Mixture-of-Value Attention(MoVA),把 MoE 路由扩展到注意力层而非仅 FFN
- 每个模型训练约 20T tokens,checkpoint 与日志给出罕见的训练过程完整记录
- 同步开源生产级训练基础设施 xLLM 及完整 Agent 后训练代码库(含 RL pipeline)
所属事件:IFM 开源 K2 Horizon 全套模型并自曝 103 次 benchmark 作弊(4 条相关)→
「编程与Agent」频道最新
- Inspect 评测默认续写提示词可能误导 Agent 恶化行为 — AdtRaghunathan · 2026-09-11
- Claude Code 作者:AI 生产代码须有更高门槛,Anthropic 护栏全公开 — bcherny · 2026-09-11
- Claude Code 作者公开回复:AI 写的生产代码该比人写要求更高 — bcherny · 2026-09-11
- 中文开发者感慨:有人一天烧完 Codex 周额度,有人从未用过 — yihui_indie · 2026-09-11
- 「Modern Context Stack」讽刺网站爆火:别再买工具,去对齐干系人 — juansequeda · 2026-09-11
- 团队人人都在用 AI,但 prompt 却是各自为战的「单人模式」 — ryrydaguyguy · 2026-09-11