TorchSpec 实现大规模分离式推测解码训练,已被腾讯混元等采用
zhyncs42 · x · 2026-07-30
TorchSpec 团队发布了关于大规模分离式推测解码训练的开源项目文章。随着 Kimi K2.5、GLM 5 等千亿参数大模型对长上下文和智能体工作流的需求增加,高效推理成为关键瓶颈。
文章指出,在训练 EAGLE-3 等推测解码的草稿模型时,需要从目标模型传递海量的隐藏状态(例如单条 12.8 万 token 的训练样本就需要约 7GB 数据)。传统将其预计算并存储在磁盘的方法会带来巨大的 I/O 压力。TorchSpec 率先提出并实现了分离式训练架构来解决这一系统瓶颈,目前该项目已被 DigitalOcean、CoreWeave 等云厂商采用,腾讯混元甚至基于此扩展出了全新的 AngelSpec 算法。
「Infra」频道最新
- 驳斥「DeepSeek与国产光刻机」恐慌论:被夸大的成本与差距 — teortaxesTex · 2026-07-30
- 微软 Azure 季度增速达 43%,AI 算力需求持续超越供给 — firstadopter · 2026-07-30
- 纯CPU跑通 Kimi K3:自研 Q3 量化占用 1.1TB,速度达 4.2 t/s — Fun-Meaning-6474 · 2026-07-30
- GPT-6将实现自我迭代优化推理算力 — imjustnewatai · 2026-07-30
- vLLM 上线 Kimi K3 Day-0 支持,8 张 B300 即可跑满 2.8T MoE — vllm_project · 2026-07-30
- vLLM 联合 Baseten 上线 Kimi K3 生产级 API — vllm_project · 2026-07-30