M5 Ultra 首批基准曝光:跑 Qwen3 27B q4 达 50 tok/s
Ashefromapex · reddit · 2026-09-17
Reddit 用户发现 omlx.ai 上出现了 M5 Ultra 的首批(非官方)推理基准:运行 Qwen3 27B 的 q4 量化版本,在 8k 上下文、未启用 MTP 的情况下,生成速度约 50 tok/s,prompt 处理速度约 1800 tok/s。发帖人认为数据来源可信度存疑但结果看起来合理,表现相当有前景。
「Infra」频道最新
- 黄仁勋:英伟达明年芯片销量将比今年翻一倍 — zephyr_z9 · 2026-09-17
- GlobalFoundries 与 Marvell 扩建佛蒙特厂,增产 AI 光互连芯片 — zephyr_z9 · 2026-09-17
- 26100 美元的桌面 AI 数据中心:双 RTX PRO 6000 开源工作站 — dee_hw · 2026-09-17
- 爆料称华为拟扩 4096 卡超节点,单节点 HBM 可达 384TB — zephyr_z9 · 2026-09-17
- Brad Gerstner:43GW 算力预测太激进,实际约 25GW 一半归 OpenAI/Anthropic — firstadopter · 2026-09-17
- Cohere 用单个 CUDA megakernel 服务 30B 模型,batch 1 达 292 tokens/秒 — dl_weekly · 2026-09-17