OpenAI 自研芯片 Jalapeño:700W 打赢英伟达 1400W,每瓦吞吐高近 2 倍
新智元 · wechat · 2026-09-10
Anthropic 已确认组建内部定制芯片团队为 Claude 设计专用推理芯片,OpenAI 则在 HotChips 大会上公布自研推理芯片 Jalapeño 的完整基准测试:700W 功耗对标英伟达 1200W 的 GB200 和 1400W 的 GB300,每瓦吞吐高出 1.5-1.9 倍,端到端延迟低 1.7-3.6 倍。同期高通与亚马逊签下 600 亿美元量级的定制推理芯片合作,头部玩家集体转向推理。
- Agent 改变了计算形态:推理从一次性短请求变成持续运行的任务链(多轮推理、工具调用、重试),要求系统长时间在线、可恢复、成本可控。
- Jalapeño 的三段式架构:把推理拆为 Prefill(算力密集)、Draft(投机采样,延迟敏感)、Verification(带宽密集+MoE 通信)三步,单芯片覆盖三种模式、KV 缓存留在本地、闲置计算单元断电,以均衡架构适应动态负载——这是 700W 打赢 1400W 的关键。
- 中国的断层:应用层丰富、芯片路线多元(RISC-V、Chiplet、存算协同),但芯片间/系统间适配迁移成本高,多元路线若各自为战会变成碎片化。
- 文末宣传将于 9 月 21 日北京举行的 AICC2026 大会及《2026 中国人工智能计算力发展评估报告》。
「Infra」频道最新
- DeepSeek 发布 V4.1-Flash:百万 token 上下文,KV 缓存缩小 4 倍 — matlabulous · 2026-09-11
- 8GB 显存还能干嘛?网友求解小模型现状与推荐 — riceinmybelly · 2026-09-11
- 西班牙新规要求 80% 逐小时绿电匹配,数据中心建设或耗资千亿欧元 — eherrerosj · 2026-09-11
- Draghi 引用 ECB 研究:AI 或每年提振欧洲生产率 0.3-0.4 个百分点 — rohanpaul_ai · 2026-09-11
- 高通新一代 Hexagon NPU 曝光:可跑 30B MoE,上下文 32K — lee_stott · 2026-09-11
- 斯坦福论文:本地+云端混合路由可省 60%-80% 算力成本 — rohanpaul_ai · 2026-09-11