a16z 领投 Gimlet Labs:异构多芯片推理云,同功耗下吞吐提升至 10 倍
a16z Newsletter · rss · 2026-09-05
a16z 宣布投资 Gimlet Labs,称其为首个“多硅推理云”,目标是“从每一瓦中榨出更多智能”。
为什么是现在
AI 推理是资本主义史上增长最快的市场之一,而算力所需的一切物理投入都在短缺:带电土地、涡轮机、变压器、数据中心、GPU、先进制程晶圆与高带宽内存。GPU 租赁价格创纪录,OpenAI 和 Anthropic 的增长受限于算力扩张速度。预计五家美国超大规模厂商明年资本开支合计 1 万亿美元,NVIDIA 已联合资本方动员超 5000 亿美元建设 AI 工厂。
推理不是单一负载
语音助手看重延迟、批处理看吞吐、研究代理看每 token 成本;一次模型调用还拆成算力密集的 prefill 和内存受限的 decode;代理又在小模型、大推理模型、CPU 代码执行与外部工具间路由。没有任何单一处理器能在所有应用和每一步上都最优——GPU 仍是基石,但将与 CPU、内存优化系统和专用芯片并存。难点在于让异构硬件作为一个系统协同(软件协调、散热与供电各异,如 Cerebras 与 NVIDIA 系统进水温度要求不同)。
Gimlet 的方案
Gimlet 为每个负载生成平衡延迟、吞吐与成本的执行计划:可将不同模型和工具路由到不同处理器、拆分 prefill/decode、在层或算子级切分模型;编译器按目标硬件优化,运行时跨系统协调,对开发者暴露单一推理 API。物理层面它把 GPU、CPU 与专用加速器整合成一个容量池,统一管理网络、供电与冷却差异。号称在相同功耗下为前沿模型带来最高 10 倍的吞吐与交互性提升,客户已包括一家前沿实验室和一家超大规模厂商。
「创投」频道最新
- 独立开发上线 Social Bid:品牌竞价赞助 X 账号,作者拿 80% 分成 — alexmacgregor__ · 2026-09-05
- 融资难?创始人建议:先把赚钱这件事做好 — arian_ghashghai · 2026-09-05
- 算力变现效率差 5 倍:智谱每兆瓦仅 800-1000 万美元,Anthropic/OpenAI 达 4000-5000 万 — zephyr_z9 · 2026-09-05
- 开源金融 Agent Skills 合集:2.8k 星,让 LLM 变身华尔街分析师 — tom_doerr · 2026-09-05
- Cathie Wood 盛赞 Block:重组激活 AI 后产品交付速度惊人 — CathieDWood · 2026-09-05
- 回应 Sam Lessin:企业 AI 是把产品变成服务,数字同事来了 — arieljalali · 2026-09-05