M5 Ultra 首批基准曝光:跑 Qwen3 27B q4 达 50 tok/s

Ashefromapex · reddit · 2026-09-17

Reddit 用户发现 omlx.ai 上出现了 M5 Ultra 的首批(非官方)推理基准:运行 Qwen3 27B 的 q4 量化版本,在 8k 上下文、未启用 MTP 的情况下,生成速度约 50 tok/s,prompt 处理速度约 1800 tok/s。发帖人认为数据来源可信度存疑但结果看起来合理,表现相当有前景。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →