TensorFold v0.3.4:M3 Ultra 上 Qwen 27B 解码翻倍至 158 tok/s

TheMoonMidas · x · 2026-09-27

面向 Apple Silicon 的开源推理引擎 TensorFold 发布 v0.3.4,为 M1–M4 芯片启用并行 lane 推测解码,在 M3 Ultra(256GB)上将 Qwen3.8-27B 代码任务解码速度翻倍至 141–158 tok/s。

核心机制:"Draft wide, commit exact"——单输入流并行草拟多个候选 token,由目标模型一次校验后仅接受匹配前缀。官方实测数据:

基于 MLX + Metal,提供 OpenAI 兼容 API,代码开源于 GitHub。下一步将推出 lane batching,并发场景已有早期收益。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →