NVFP4 让 2.4 万亿参数模型只用 1/4 GPU,单 token 成本最高降 73%

ryanshrout · x · 2026-10-07

Signal65 PINNACLE 测试显示:以 BF16 精度在 NVIDIA GB300 NVL72 机架上服务一个 2.4 万亿参数模型,需要占用 18 个节点中的 16 个;改用 NVFP4 后同样的模型只需 4 个节点,吞吐量仍达 BF16 的 93%。

折算下来,每块 GPU 承担的工作量提升 3.7 倍,单输出 token 成本最高降低 73%。作者提醒计划自建硬件跑前沿开源模型的人:模型实际占用的 GPU 数量才决定真实成本,而 NVFP4 能大幅压缩这一数字。Signal65 PINNACLE 项目正随 NVIDIA 合作迈向机架规模。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →