OpenAI自研芯片Jalapeño曝光:九个月流片,主打低延迟推理
bigdata · x · 2026-09-18
OpenAI 硬件副总裁 Richard Ho 在播客中详解公司首款自研 AI 加速器 Jalapeño 的设计思路与开发过程。
- 九个月流片:团队借助 AI 工具压缩部分开发环节,将芯片从设计到流片周期缩短至九个月。
- 核心动机:掌控更多硬件栈以降低推理成本、提升性能,而非单纯追求算力峰值。
- 架构特点:采用「空白画布」设计,把内存与计算拉近,打破吞吐与延迟之间的传统取舍,同时兼顾高吞吐与低延迟,面向通用 LLM 与开源模型。
- 瓶颈判断:数据中心真正的瓶颈正从芯片转向电力。
- 软件栈:涉及 CUDA、Triton、投机解码、kernel 优化,以及 InferenceX、AgentX 等跨模型基准。
- 路线图:从第一代走向第三代,涉及 HBM4 与新内存;强化学习与智能体推高推理需求。
- CUDA 护城河:讨论 CUDA 是否仍是壁垒,以及 AI 与新型硬件带来的可选性。
所属事件:OpenAI首芯片Jalapeño曝光:9个月流片(5 条相关)→
「Infra」频道最新
- 421M 参数 Laya 模型经 OpenVINO INT8 量化后纯 CPU 玩 Flappy Bird — simpleuserhere · 2026-09-23
- MLX-Serve 发布 v26.95:Qwen-Image 2.1 上 Mac,四路并发提速近一倍 — TheMoonMidas · 2026-09-23
- DigitalOcean Managed Agents 公测:闲置即暂停,接 75+ 模型 — HeyAmit_ · 2026-09-23
- 换掉最终决策层:Qwen+SGLang 比 Jev 快 37% 且精度相当 — VeryWellVersed · 2026-09-23
- Reka EdgeQ 端侧 VLM 登陆骁龙 8 Elite,首 token 仅 0.73 秒 — RekaAILabs · 2026-09-23
- 为 OpenCode 写缓存友好压缩插件,本地模型提速近 10 倍 — schennardo · 2026-09-23