巨头竞逐推理速度:GPT 5.6 跑出 750 tok/s

DeepLearningAI · x · 2026-09-02

OpenAI、Google 和 Nvidia 等头部公司近期密集发布以速度为核心的更新。OpenAI 与 Cerebras 合作演示了 GPT 5.6 Sol,通过 Cerebras 硬件实现 750 tokens/秒 的吞吐量,比 OpenAI 自家 API 快约 11 倍。Google 发布 Gemini 3.7 Flash,平均速度 330 tokens/秒。Nvidia 推出 Nemotron 3.5 Lightning 并引入动态步路由。更快的吞吐和更低的延迟对减少开发者上下文切换和支持实时 Agent 工作流至关重要。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →