解析NVIDIA NVFP4预训练方案
nrehiew_ · x · 2026-07-13
推文解析了 NVIDIA 的 **NVFP4 预训练方案**,指出该方案主要借鉴了此前 Nemotron 的相关工作: - **Hadamard 变换**:应用于权重梯度计算,以减少异常值的影响。 - **选择性高精度**:部分层(如最终层)保持高精度,因为它们需要比 FP4 更大的动态范围和尾数。 - **随机舍入**:在梯度计算中采用随机舍入而非确定性舍入,以防止偏差。 为验证该方案,团队训练了高达 16T tokens 的较小模型,结果显示其与 BF16 基线相比,仅有约 0.4% 的相对训练损失差距。
所属事件:NVIDIA NVFP4 量化与预训练方案原理深度解析(2 条相关)→
「Infra」频道最新
- Cloudflare 验证页开始识别 AI 代理而不只是人类 — shashib · 2026-07-21
- 多节点 vLLM 经过拓扑调优,单用户吞吐升至 47 tok/s — TheZachMueller · 2026-07-21
- AI 辅助 GPU 调试用上 NVIDIA Nsight Systems 套件 — MonaJalal_ · 2026-07-21
- Databricks 称向量检索加 AI Classify 比前沿模型便宜 100 倍 — hanlintang · 2026-07-21
- Gemini Batch API 延迟降 80%,Google 还加入部分批处理支持 — OfficialLoganK · 2026-07-21
- 中国算力、SeedAudio 与飞书 ARR 同步更新的 AI 资讯汇总 — APPSO · 2026-07-21