TPU 的 fp32 精度陷阱
JFPuget · x · 2026-07-20
这条帖结合配图指出了一个 TPU 上很容易踩坑的细节:即使你请求的是 fp32 matmul,TPU 默认也可能按 bf16 执行。
作者提到,训练命令里的 --lm-head-precision highest 看起来像是在保护质量,但实际上并不起作用,因为 TPU 的默认行为会把这类计算落到 bf16。配图里的 JAX 例子也说明了这一点:输入是 fp32,但默认精度路径仍然会被使用。
作者强调,这不是隐藏 bug,而是文档里写明的默认行为;甚至连 Google 研究员都曾因此反复踩坑。核心提醒是:在 TPU 上不要被参数名字误导,必须真正理解平台的精度执行语义。
「Infra」频道最新
- 推理服务关键指标盘点:流式速度 TPOT 与可用性如何影响体验 — abhijithneil · 2026-09-11
- PlanetScale 推出分片 Postgres,768 台服务器组成 1PB 单库 — dhruv2038 · 2026-09-11
- 7900 XTX 24GB 能否跑 Qwen,Reddit 征集 ROCm 实测数据 — thenomadexplorerlife · 2026-09-11
- 实测戳破 RTK 省钱神话:token 省了,账单分文未降 — Bartaseth · 2026-09-11
- SF Compute 创始人:现在买算力是「绝对糟糕的体验」 — IgorCarron · 2026-09-11
- 开源 SmolVM:2026 年 Agent 不止用浏览器,而是拥有整台电脑 — aniketmaurya · 2026-09-11