TPU 的 fp32 精度陷阱
JFPuget · x · 2026-07-20
这条帖结合配图指出了一个 TPU 上很容易踩坑的细节:即使你请求的是 fp32 matmul,TPU 默认也可能按 bf16 执行。
作者提到,训练命令里的 --lm-head-precision highest 看起来像是在保护质量,但实际上并不起作用,因为 TPU 的默认行为会把这类计算落到 bf16。配图里的 JAX 例子也说明了这一点:输入是 fp32,但默认精度路径仍然会被使用。
作者强调,这不是隐藏 bug,而是文档里写明的默认行为;甚至连 Google 研究员都曾因此反复踩坑。核心提醒是:在 TPU 上不要被参数名字误导,必须真正理解平台的精度执行语义。
「Infra」频道最新
- NVIDIA 称 Nemotron 3 Ultra 在 RTL 芯片设计任务上达 97.1% — NVIDIAAI · 2026-07-27
- NVIDIA 说 Vera CPU 让部分 EDA 工作负载提速 1.5 倍 — NVIDIA Blog · 2026-07-27
- 本地 Qwen 模型驱动机械臂测试 78 款手机续航 — gappyvalley · 2026-07-27
- MiniBot 2.40 新增 xAI、HF Studio 和 vLLM 支持 — Creative-Type9411 · 2026-07-27
- 苹果智能眼镜、英伟达SK合作与携程51.79亿罚单汇总 — APPSO · 2026-07-27
- DeepSeek 融资传闻、欧盟 AI 透明度规则与 OpenAI 安全事故 — 创业邦 · 2026-07-27