AI 硬件竞赛转向推理:NVIDIA Groq 等速度惊人
Delicious-Flan88 · reddit · 2026-08-26
受 NVIDIA/Groq 等消息启发,作者对比了不同 LLM 提供商的推理速度,指出下一场 AI 硬件竞赛可能围绕推理展开。
关键速度数据(Token/秒)
- NVIDIA Groq 3 LPX (Gemma 4 31B): 3,400 tok/s
- Cerebras (GPT-OSS 120B): 官方 3,000 tok/s(实测 1,715 tok/s)
- Groq (Llama 3.1 8B): 1,800 tok/s
- SambaNova (Llama 3.3 70B): 476 tok/s
观点
随着 AI 智能体进入日常工作流,响应速度和推理成本将比人们预想的更重要。专用推理芯片正在变得与训练芯片同等关键。
「Infra」频道最新
- Snowflake 揭示 Agent 隐形成本,优化方案降低 33%-45% — StasBekman · 2026-08-26
- OpenAI 自研推理芯片 Jalapeño:功耗表现优于英伟达 GB300 — ivan_bezdomny · 2026-08-26
- M5 Ultra Studio 定价「破坏性」:本地模型托管性价比达 DGX Spark 的 2-3 倍 — SumitGup · 2026-08-26
- 从能耗第一性原理设计 AI 硬件会更像大脑 — prateekj · 2026-08-26
- AC2 训练基础设施助力后训练专业化模型普及 — ypatil125 · 2026-08-26
- 海边燃煤数据中心「用水冷却,如上帝所愿」 — bennash · 2026-08-26