模型推理别用 FP16:激活值超动态范围会静默退化

tomaarsen · x · 2026-10-07

作者提醒:跑该模型时不要用 FP16,应使用 BF16 或 FP32。原因是模型的激活值范围超出 FP16 的动态范围,模型卡也警告会出现 NaN 或嵌入向量静默退化。原生支持 BF16 的平台优先用 BF16,其余场景(包括大多数 CPU)用 FP32。

被引用的原帖补充了多模态输入默认参数:视频默认每秒采样 1 帧,音频应为 16 kHz 单声道;视觉预算可在每张图/每帧 70 到 1120 个 soft token 之间配置,token 越多视觉细节越精细,但会牺牲延迟与上下文容量。

所属事件:谷歌开源 EmbeddingGemma 2 多模态嵌入模型(33 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →