NVFP4 让 2.4 万亿参数模型只用 1/4 GPU,单 token 成本最高降 73%
ryanshrout · x · 2026-10-07
Signal65 PINNACLE 测试显示:以 BF16 精度在 NVIDIA GB300 NVL72 机架上服务一个 2.4 万亿参数模型,需要占用 18 个节点中的 16 个;改用 NVFP4 后同样的模型只需 4 个节点,吞吐量仍达 BF16 的 93%。
折算下来,每块 GPU 承担的工作量提升 3.7 倍,单输出 token 成本最高降低 73%。作者提醒计划自建硬件跑前沿开源模型的人:模型实际占用的 GPU 数量才决定真实成本,而 NVFP4 能大幅压缩这一数字。Signal65 PINNACLE 项目正随 NVIDIA 合作迈向机架规模。
「Infra」频道最新
- 泡沫期创业拿云厂积分的暗坑:克隆、账单陷阱与烂服务 — mkheck · 2026-10-07
- Intel 高管:agentic AI 大量时间耗在等待,关键指标是端到端时长 — ryanshrout · 2026-10-07
- 三台异构机器跑本地推理,如何统一服务与监控? — ziyaulhuk12 · 2026-10-07
- Beff Jezos:解耦推理是未来,异构算力云正当其时 — beffjezos · 2026-10-07
- 「拥有自己的 AI」在技术上到底意味着什么? — Imaginary_Choice_430 · 2026-10-07
- NVIDIA 发布 LoGRA:低秩梯度草图把 LLM 强化学习训练内存最高省 45.7% — nvidia · 2026-10-07