GB300 NVL72 实测:仅调 FP8 KV cache 与 GPU 分配,吞吐最高提升 64%
ryanshrout · x · 2026-10-02
Signal65 发布其 agentic AI 基准 PINNACLE 的机架级(rack scale)首批 NVIDIA GB300 NVL72 调优结果:在模型、节点、负载完全不变的前提下,仅改软件设置就能大幅提升产出。
- FP8 KV cache 使大型 MoE 模型吞吐提升 59%–64%;
- 调整 GPU 分配方式使 GLM-5.3-Flash 再提升最高 61%,相当于每输出 token 成本降低最高 39%。
PINNACLE 的定位是衡量「正确的产出」:用运行时生成的答案密钥做确定性代码评分(无模型裁判),每轮运行程序化重建沙箱与密钥,杜绝记忆与过拟合;跑的是真实多步 agentic 会话而非回放轨迹。NVIDIA(Ian Buck)与 AMD 均表态支持该基准的演进。结论:企业已购的 AI 机架若服务栈未调优,就在白白浪费容量。
「Infra」频道最新
- SpaceX Transporter-18 升空:Google AI 芯片首次入轨测试 — XFreeze · 2026-10-02
- AI 算力支出高度集中:头部 10% 企业吃掉 99.5% 推理开销 — bendee983 · 2026-10-02
- Extropic 创始人喊话「Thermo RSI 要来了」,热力学计算芯片预告 — beffjezos · 2026-10-02
- 微软 Foundry 上架全系前沿模型:GPT-6、Claude Opus 5.5 一站可用 — mustafasuleyman · 2026-10-02
- Musk 表态:轨道算力将是「大事」,SpaceX 谋求太空获取海量能源 — DimaZeniuk · 2026-10-02
- DeepSeek 发布 DSec 论文:每天 300 万沙箱支撑 V3.2 到 V4.1 训练 — jiqizhixin · 2026-10-02