算力将主导前沿模型时代
deedydas · x · 2026-07-20
作者认为,未来几年 AI 的主线会落到 compute(算力) 上,原因是前沿模型的需求与供给都在快速变化。
- 以 Kimi K3 为例,模型上线 2 天就冲到 OpenRouter 前 10,日处理量约 140B tokens,但推理基础设施已经吃紧:吞吐从 30 tok/s 降到 13 tok/s,端到端延迟升到 72 秒,首 token 时间超过 20 秒。
- 他说要给“量化后的 Kimi K3”配足算力,最低也要买 8 张 B300,成本约 50 万美元;如果上更推荐的 GB300 NVL72 机架,成本约 400 万美元。
- 核心判断是:Moonshot 可能没有足够算力满足需求;即便是美国的推理服务商,也未必能快速扩容,因为 2.8T 级别模型太重。
- 许多 GPU/neocloud 已经开始签 3 年甚至 5 年、首付 30% 的长期合约,算力价格继续走高;头部实验室、超大云厂和部分大模型公司已经提前锁定资源,剩下的玩家在争抢稀缺容量。
- 结论是:虽然模型单价长期在下降,但“前沿能力”的价格并没有明显塌缩;在需求持续增长、前沿能力持续提升、而算力供给又受限的情况下,提前锁定 compute 的公司会获得更大的价值捕获。
「Infra」频道最新
- Engram 随机读取不适合 SSD,CPU 内存低延迟共享或成正解 — bookwormengr · 2026-09-11
- 劝退帖:推理工程是真金白银的硬活,八成尝鲜者已悄然放弃 — abhijithneil · 2026-09-11
- Hugging Face《Ultra Scale Playbook》:GPU 集群训练 LLM 的免费技术书 — mdancho84 · 2026-09-11
- 从聊天到 Agent,推理延迟正在成为生产级瓶颈 — Euphoric_Sea632 · 2026-09-11
- 推理服务关键指标盘点:流式速度 TPOT 与可用性如何影响体验 — abhijithneil · 2026-09-11
- PlanetScale 推出分片 Postgres,768 台服务器组成 1PB 单库 — dhruv2038 · 2026-09-11