约11美元/百万token:去中心化训练新模型推理优化曝光
bittingthembits · x · 2026-09-13
jondurbin 转发并引用了自己团队的进展:去中心化训练 run 的成本约 $11/b tokens(每十亿 token 11 美元),MFU 表现出色,他称之为"legendary"。
但他强调,真正的重点不在去中心化训练本身,而是该模型架构带来的推理优化:
- 路由专家的 sparse fp4 原生计算
- 大部分注意力使用固定 KV cache
- 其余部分用 sparse latent
- 模型权重极小
这些数字来自一个未调优的 vllm 分支在自有模型架构上的测试,作者承认对比尚不完全公平,还需与更多模型对比。核心主张:廉价硬件上无限 token 的推理能力。训练使用了 liumio 的若干节点。
「Infra」频道最新
- 本地 LLM 押注一年后:早买 GPU 的用户庆幸买晚了 — nptacek · 2026-09-13
- SGLang团队开源Miles v0.1:64卡训744B模型,每步263秒 — aigclink · 2026-09-13
- evenings 读 terahertz 脉冲反射法,逐层看 CoWoS 封装 — jwt0625 · 2026-09-13
- DeepMind 首席策略师:巨额 AI 基建投的是递归自我改进的赌注 — rohanpaul_ai · 2026-09-13
- AI 估值互相矛盾:内存股 3-5 倍 PE,Nvidia 便宜得可疑 — rohanpaul_ai · 2026-09-13
- Draw Things 推出 Local Code 公测:Mac 本地跑编程 agent,prefill 快 1.2-1.6 倍 — liuliu · 2026-09-13