Nemotron 量化细节更新

nrehiew_ · x · 2026-07-13

作者在补充一项与 **Nemotron** 相关的量化策略: - **最后 15%** 的部分保留为 **bf16** - **shared expert** 也保留在 bf16 中 - 下一步目标是把表示范围缩到 **±4**,以降低最大相对误差 - 对激活值和权重,会同时计算多种方案,再选**表示误差最小**的那个 - 但这样做的代价是**算得更贵**,所以需要依赖 kernel 层优化 这是一条偏工程实现细节的研究/训练笔记。

所属事件:4bit量化训练与Nemotron细节更新(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →