a16z 领投 Gimlet Labs:异构多芯片推理云,同功耗下吞吐提升至 10 倍

a16z Newsletter · rss · 2026-09-05

a16z 宣布投资 Gimlet Labs,称其为首个“多硅推理云”,目标是“从每一瓦中榨出更多智能”。

为什么是现在

AI 推理是资本主义史上增长最快的市场之一,而算力所需的一切物理投入都在短缺:带电土地、涡轮机、变压器、数据中心、GPU、先进制程晶圆与高带宽内存。GPU 租赁价格创纪录,OpenAI 和 Anthropic 的增长受限于算力扩张速度。预计五家美国超大规模厂商明年资本开支合计 1 万亿美元,NVIDIA 已联合资本方动员超 5000 亿美元建设 AI 工厂。

推理不是单一负载

语音助手看重延迟、批处理看吞吐、研究代理看每 token 成本;一次模型调用还拆成算力密集的 prefill 和内存受限的 decode;代理又在小模型、大推理模型、CPU 代码执行与外部工具间路由。没有任何单一处理器能在所有应用和每一步上都最优——GPU 仍是基石,但将与 CPU、内存优化系统和专用芯片并存。难点在于让异构硬件作为一个系统协同(软件协调、散热与供电各异,如 Cerebras 与 NVIDIA 系统进水温度要求不同)。

Gimlet 的方案

Gimlet 为每个负载生成平衡延迟、吞吐与成本的执行计划:可将不同模型和工具路由到不同处理器、拆分 prefill/decode、在层或算子级切分模型;编译器按目标硬件优化,运行时跨系统协调,对开发者暴露单一推理 API。物理层面它把 GPU、CPU 与专用加速器整合成一个容量池,统一管理网络、供电与冷却差异。号称在相同功耗下为前沿模型带来最高 10 倍的吞吐与交互性提升,客户已包括一家前沿实验室和一家超大规模厂商。

原文链接 →

「创投」频道最新

更多「创投」频道 AI 资讯 →