NVIDIA 展示 Qwen 27B 模型输出速度达每秒 2529 tokens

IanAndrewsDC · x · 2026-09-28

NVIDIA 推理负责人 Ian Buck 在 GTC 活动上登台,展示了 Qwen 3.8 27B 模型的推理性能:输出速度达到每秒 2529 tokens。这一数据由现场观众转述并引起 SemiAnalysis、Cerebras 等推理服务商相关人士关注,可用于对比各家推理栈的吞吐能力。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →