K2 Horizon 用 LoRA 并行解码提速 3 倍,预训练吃下 20T tokens
rohanpaul_ai · x · 2026-09-11
K2 Horizon 系列随附 Uno Diffusion——一个 LoRA 适配器,让原始自回归模型保持冻结,同时学会并行生成 token 块。这意味着无需单独的草稿模型、无需迁移基础模型,IFM 称推理速度提升约 3 倍且模型质量无损。
其他细节:
- 每个模型预训练约 20T tokens,混合网页、代码、数学、科学、多语言与合成数据
- 预训练语料约 17% 含显式推理轨迹,使用了约 10T 合成 tokens
- 后训练阶段生成了 1 亿+ 独立任务
- 全系列共享同一套基础训练、对话、工具调用与部署栈,vLLM、SGLang、Ollama 零日支持,覆盖 NVIDIA、AMD、Cerebras 硬件
所属事件:K2 Horizon 预训练 20T tokens,LoRA 并行解码提速 3 倍(2 条相关)→
「Infra」频道最新
- 马斯克转发 SpaceX CFO 演讲纪要:垂直整合+轨道算力布局 — elonmusk · 2026-09-11
- 贝索斯:电力供应链成瓶颈,算力滞后迫使各实验室放慢研发 — beffjezos · 2026-09-11
- vLLM 升级要点:KV 卸载、队列控制与 Blackwell 延迟降 33.6% — vllm_project · 2026-09-11
- vLLM v0.29.0 性能升级:Blackwell 端到端延迟降 33.6%,内核级提速 7 倍 — vllm_project · 2026-09-11
- 一个芝士汉堡的碳排放约等于 6.3 万次 Gemini 提问 — recallingmemories · 2026-09-11
- 传 spcx 一周前再签超大算力协议,ARR 达 130 亿美元 — rwang07 · 2026-09-11