推理瓶颈在带宽而非算力,Positron 反转 GPU 设计路线解析
lemire · x · 2026-09-11
计算机学者 Daniel Lemire 论证:LLM 推理才是必须做便宜的那一环,而现有硬件大多不是为它设计的。
核心论点:
- 推理受限的是带宽:对巨大的权重矩阵做大量矩阵-向量乘法,权重几乎不被复用,更像流媒体视频而非仿真或游戏渲染。
- NVIDIA 等 GPU 是为图形/计算优先设计的:先堆算力再外挂高带宽内存(HBM),代价昂贵。
- 显然的对偶方案是反转设计:把权重放在第一位,让权重流以高利用率流过,只配足够的算力喂饱数据流。带宽才是稀缺资源。
- 代表公司是美国创业公司 Positron:已出货推理整机 Atlas,并在造定制芯片 Asimov,把权重放在乘法器旁边,用普通商用内存替代 HBM。
局限:这些机器不像 GPU 可编程,而是提供 OpenAI 兼容 API,更像 Web 服务而非通用加速卡。
「Infra」频道最新
- 前 OpenAI 研究员预测:机器人建厂后算力产业每三个月翻倍 — victor_explore · 2026-09-11
- 曝 DeepSeek V4.1 Flash 将 prefill/decode 分离直接写入模型权重 — altryne · 2026-09-11
- Oracle 未上调债务预期股价大涨,评论称其本质是 GPU 大宗服务生意 — TiernanRayTech · 2026-09-11
- 97.5% 缓存命中率仍藏一半账单:六 Agent 公司实测省钱 59% — Icy_Comfort_6220 · 2026-09-11
- 华为发布近封装光学新标准,挑战英伟达与博通 — pstAsiatech · 2026-09-11
- Redis 只作缓存就关掉快照和日志,磁盘占用大幅下降 — DanielLockyer · 2026-09-11