GPU 统治深度学习纯属偶然,定制 chiplet 架构或将重塑推理
ai · x · 2026-09-30
fleetwood.dev 发布长文《Domain specific architectures for AI inference》,论证当前 GPU 在深度学习中的主导地位很大程度是历史偶然——其图形计算负载恰好与深度学习相似,残留的图形架构遗产至今仍在。作者引用 Onur Mutlu 观点指出大型 ML 模型中超过 90% 的系统能耗花在内存上,认为"以计算为中心"的思维方式就像哥白尼之前的地心说。
文章核心论点:
- 模型架构被硬件"反向塑造":功耗与资本约束下,摩尔定律和 Dennard 缩放放缓,迫使架构师转向领域专用架构(DSA)
- 所谓 dmodel、矩阵尺寸必须是 2 的幂等"最优假设",其实是 CUDA warp 和 HBM 限制妥协的产物,未必是信息论意义上的最优
- 训练/推理芯片分离只是开始,未来将出现大规模模型 disaggregation,chiplet 封装与互连成为关键
- 应该从 Transformer 推理负载倒推,重新设计专用推理硬件
转发者评论称当前 LLM 设计像是"硬件斯德哥尔摩综合征",定制 chiplet 与互连将是下一步方向。
「Infra」频道最新
- Hugging Face 发布 tokenizers v1:性能较 v0.23 提升数十倍 — ariG23498 · 2026-09-30
- Altman:OpenAI 自研芯片 2027 上半年上线,押注推理优势 — johncoogan · 2026-09-30
- AAOI 美国垂直整合过激:激光器产线良率仍差,烧掉大量资本开支 — jwt0625 · 2026-09-30
- PrismQuant 用零空间旋转优化 INT4 量化,70B 模型几乎无损 — NanyangTechnologicalUniversity · 2026-09-30
- AI 算力吞噬全球资本,CFO 警告投资级利率或破 10% — sudoraohacker · 2026-09-30
- 字节发布 HELIX 架构:序列检索与特征交互统一建模已上线 TikTok — _reachsumit · 2026-09-30