Thinky 发布模型卡,B200 实测吞吐和部署数据一并公开

TheZachMueller · x · 2026-07-22

Thinky Machines 发出了模型卡,并特意等到 SGLang 和 vLLM 支持都到位后再公布数据。

图中给出的基准是在 NVIDIA HGX B200、CUDA 13.0 上跑的,使用官方 NVFP4 checkpoint、TP=8 配置。模型卡把它描述为“很快、能力很强”,并给出了关键吞吐指标:单用户生成吞吐 2,510.64 tok/s、总吞吐 12,553.21 tok/s,平均 TTFT 2,023.21 ms、平均 ITL 11.76 ms。

所属事件:Thinky 发布模型卡并公布 B200 实测数据(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →