模型推理别用 FP16:激活值超动态范围会静默退化
tomaarsen · x · 2026-10-07
作者提醒:跑该模型时不要用 FP16,应使用 BF16 或 FP32。原因是模型的激活值范围超出 FP16 的动态范围,模型卡也警告会出现 NaN 或嵌入向量静默退化。原生支持 BF16 的平台优先用 BF16,其余场景(包括大多数 CPU)用 FP32。
被引用的原帖补充了多模态输入默认参数:视频默认每秒采样 1 帧,音频应为 16 kHz 单声道;视觉预算可在每张图/每帧 70 到 1120 个 soft token 之间配置,token 越多视觉细节越精细,但会牺牲延迟与上下文容量。
所属事件:谷歌开源 EmbeddingGemma 2 多模态嵌入模型(33 条相关)→
「编程与Agent」频道最新
- Coinbase 工程师谈 x402:如何给 AI Agent 设计支付方案 — MurrLincoln · 2026-10-07
- Resend 单月 MCP 调用达 300 万次,半年增长近 30 倍 — dsp_ · 2026-10-07
- 开发者用 Claude 克隆自己两年游戏:像但不像,从此不怕被 AI 抄 — IanArawjo · 2026-10-07
- YC 孵化 Linc 发布:把企业隐性规则变成 Agent 可用的 SOP — ycombinator · 2026-10-07
- 别急着删 agent 记忆系统:作者实测内部流程仍需聚焦式 md 文件 — gregbarbosa · 2026-10-07
- 不用 RAG 的 agent 记忆系统:Markdown 文件省下 15.5 万 tokens — gregbarbosa · 2026-10-07