TimesFM 3.0 新增 MLX 后端:苹果芯片原生跑时序预测,M4 Max 每秒 641 序列
rachittshah · x · 2026-09-08
开发者在 Google 官方 timesfm 仓库提交的 MLX 后端 PR #476 已被合并,与 PyTorch 实现功能完全对齐。
- TimesFM 3.0 是 Google 的 330M 参数时序预测基础模型,以 32 点 patch 读历史、单次前向输出未来 64 步(每步 9 个分位数)。
- 新后端位于 src/timesfm3/mlx,与 PyTorch API 接口一致;原 torch 实现移入 src/timesfm3/torch,顶层包惰性导出,import timesfm3 不再强制安装 torch。
- M4 Max 实测(512 点上下文、64 步预测):batch 1 时单序列 12.5 ms,batch 32 时每秒 641 个序列;与 PyTorch 参考实现最大差异仅 2.1e-6(float32 噪声级)。
- batch 1 下 1.9 倍加速来自 mx.compile 而非量化——330M 参数规模下模型受 dispatch 瓶颈主导,bf16 和 int8 量化收益有限。
「Infra」频道最新
- CPU 短缺波及软件团队:AI 芯片供给约束正在外溢 — brada · 2026-09-08
- 大型科技公司选址阿根廷巴塔哥尼亚,拟建超大数据中心 — Polymarket · 2026-09-08
- 数据中心建设拉动货运:7月Cass指数跌4.5%却掩盖了真实需求 — kernelangus420 · 2026-09-08
- 官方 llama.cpp 浪费硬件,Strix Halo 优化分支解码近 60 t/s — feelspeaceman · 2026-09-08
- AMD 桌面 AI 工作站内存 2.6TB,达 NVIDIA DGX Station 三倍多 — shashib · 2026-09-08
- Minecraft 创始人吐槽:AI 服务该允许付费直接开高配 VM — DavidSHolz · 2026-09-08