Pixel 9A TPU 跑矩阵乘法:1x1 卷积是压榨算力的最优解

mgostIH · x · 2026-10-09

作者 mgostIH 在调试 Pixel 9A 的 TPU(G4)编译器时发现:基础 matmul 的性能对编译器偏好极其敏感。经验是用常量参数的 1x1 卷积(1x1 convs with constant parameters)是压榨 TFLOP/s 的最佳方式,但必须找到编译器的「happy path」,否则编译会直接超时。属于一手端侧芯片调优经验。

所属事件:开发者吐槽 Pixel 9A TPU 编译器质量差且算力数据不公开(3 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →