英伟达将演示 NVFP4 预训练配方,逼近 BF16 质量
PyTorch · x · 2026-09-01
NVIDIA 研究人员将在 PyTorch Conference North America 2026 上展示最新的 NVFP4 预训练配方,该配方旨在加速大规模 LLM 训练,同时缩小与 BF16 在质量上的差距。会议将于 10 月 21 日举行,内容涵盖配方设计、内核选择以及原生 PyTorch 工作流所需的 API。目前,稠密线性 NVFP4 训练已通过 TorchAO 开源,相关配方正通过 TorchAO 和 TorchTitan 上游至 PyTorch 生态。
「Infra」频道最新
- Qwen3.8 Flash 在双 DGX 上跑出 415 tok/s — NVIDIAAI · 2026-09-01
- 曝 OpenAI 自研芯片 Jalapeno:LLM 推理速度达 1500 tokens/s — firstadopter · 2026-09-01
- TensorSharp 跑 Qwen 3.8 Flash Next 性能实测 — fuzhongkai · 2026-09-01
- 腾讯混元 AngelSlim:Hy4 模型压缩至 214GB 并支持异构协同 — 腾讯混元 · 2026-09-01
- 三星为英伟达改推8层HBM4E,速率要求提高20% — 创业邦 · 2026-09-01
- 为何 Llama.cpp 中增大上下文反而提升了推理速度? — satnl · 2026-09-01