Thinky 发布模型卡,B200 实测吞吐和部署数据一并公开
TheZachMueller · x · 2026-07-22
Thinky Machines 发出了模型卡,并特意等到 SGLang 和 vLLM 支持都到位后再公布数据。
图中给出的基准是在 NVIDIA HGX B200、CUDA 13.0 上跑的,使用官方 NVFP4 checkpoint、TP=8 配置。模型卡把它描述为“很快、能力很强”,并给出了关键吞吐指标:单用户生成吞吐 2,510.64 tok/s、总吞吐 12,553.21 tok/s,平均 TTFT 2,023.21 ms、平均 ITL 11.76 ms。
所属事件:Thinky 发布模型卡并公布 B200 实测数据(2 条相关)→
「模型」频道最新
- 写作指纹分析称 Kimi K3 与 Fable 5 过于相似 — alex_verem · 2026-07-23
- Cisco 称两款开源安全小模型在漏洞检测上更省钱 — The Decoder · 2026-07-23
- Laguna-S-2.1 败在 100 米步行决策测试 — logic_prevails · 2026-07-23
- BTL-3 以 8.39GB 文件发布 27B 开源 agent 模型 — QuixiAI · 2026-07-23
- Claude Opus 4.8 占 OpenRouter 上 Anthropic 用量 40% — maferase · 2026-07-23
- GLM 复现 cmatrix 几乎满分,只差“Computer locked.” — jyangballin · 2026-07-23