曝 OpenAI 自研芯片 Jalapeno:LLM 推理速度达 1500 tokens/s
firstadopter · x · 2026-09-01
Tae Kim 报道了 OpenAI 在 Hot Chips 大会上展示的自研芯片 Jalapeno。关键信息包括:
- 全栈优化:从模型、软件、编译器到底层硅片进行全栈优化,仅用 9 个月完成 RTL 执行。
- 高性能表现:在 OSS 模型上实现接近 1500 tokens/s 的用户吞吐量,延迟降低 4 倍;在 DeepSeek 模型上达到 700 tokens/s,延迟降低 5 倍。
- 设计目标:专注于加速 OpenAI 工作负载,解决用户等待时间和能耗问题。
「Infra」频道最新
- Google Cloud Monitoring MCP 连接器发布 — modelcontextprotocol · 2026-09-01
- Distributed.systems发布可审计的Agent基础设施 — arthurcolle · 2026-09-01
- ChatGPT 启用记忆和历史会话是否增加 Token 消耗? — ssunki · 2026-09-01
- 工程师深挖 ROCm,修复 MI350X 推理崩溃并发现 9 个 Bug — AnushElangovan · 2026-09-01
- 40nm 神经动力学芯片:利用电导漂移实现单次迭代 2.12ms 延迟 — maier_ak · 2026-09-01
- Qwen3.8 Flash 在双 DGX 上跑出 415 tok/s — NVIDIAAI · 2026-09-01