TensorFold v0.3.4:M3 Ultra 上 Qwen 27B 解码翻倍至 158 tok/s
TheMoonMidas · x · 2026-09-27
面向 Apple Silicon 的开源推理引擎 TensorFold 发布 v0.3.4,为 M1–M4 芯片启用并行 lane 推测解码,在 M3 Ultra(256GB)上将 Qwen3.8-27B 代码任务解码速度翻倍至 141–158 tok/s。
核心机制:"Draft wide, commit exact"——单输入流并行草拟多个候选 token,由目标模型一次校验后仅接受匹配前缀。官方实测数据:
- M5 Max 128GB + Nemotron 3.5 Lightning 30B-A3B:188–206 tok/s(MTP 头默认启用)
- M5 Max 128GB + Qwen3.8 27B(DFlash2):120–124 tok/s(无草稿时 27 tok/s)
- M3 Ultra 256GB + Qwen3.8 Flash Next:88–92 tok/s(无草稿时 79 tok/s)
基于 MLX + Metal,提供 OpenAI 兼容 API,代码开源于 GitHub。下一步将推出 lane batching,并发场景已有早期收益。
「Infra」频道最新
- AI Agent 用 TensorRT 把 Orpheus 3B 推理 RTF 从 1.03 压到 0.87 — TheMoonMidas · 2026-09-27
- 质疑 DeepSeek 华为算力难以盈利,梁文锋 10 个月回本目标存疑 — teortaxesTex · 2026-09-27
- 5千澳元预算如何搭建本地推理主机:二手3090还是AMD新卡 — Smooth-Television-48 · 2026-09-27
- Oracle 触发不可抗力条款,全行业被叫停数据中心达 2000 亿美元 — generativist · 2026-09-27
- 实测 LLM 语义缓存:危险查询反而更像安全查询,多数系统不该上 — bfeeny · 2026-09-27
- 曙光 Sugon-8000 浸没式相变液冷曝光,50 度低蒸发制冷剂散热 — teortaxesTex · 2026-09-27