巨头竞逐推理速度:GPT 5.6 跑出 750 tok/s
DeepLearningAI · x · 2026-09-02
OpenAI、Google 和 Nvidia 等头部公司近期密集发布以速度为核心的更新。OpenAI 与 Cerebras 合作演示了 GPT 5.6 Sol,通过 Cerebras 硬件实现 750 tokens/秒 的吞吐量,比 OpenAI 自家 API 快约 11 倍。Google 发布 Gemini 3.7 Flash,平均速度 330 tokens/秒。Nvidia 推出 Nemotron 3.5 Lightning 并引入动态步路由。更快的吞吐和更低的延迟对减少开发者上下文切换和支持实时 Agent 工作流至关重要。
「Infra」频道最新
- 矿渣重生:CMP170HX 双卡跑 Qwen Flash Next,实测 4000 tps 处理速度 — Miserable-Dare5090 · 2026-09-02
- VMware 私有 AI 全家桶发布,企业 AI 从实验走向生产 — DavidLinthicum · 2026-09-02
- 美国仍掌握全球大部分算力,优势巨大 — peterwildeford · 2026-09-02
- ARK 分析师:人均 GDP 每增加 1 美元就需 1 度电 — skorusARK · 2026-09-02
- 观点:农村美国因科技界糟糕的游说而抵制数据中心 — wordgrammer · 2026-09-02
- 英伟达下调利润目标以重置成本,押注执行力 — TansuYegen · 2026-09-02