oMLX 新版提速明显:Qwen3.6 解码 +31%,新增决策模型支持
pcuenq · x · 2026-10-10
oMLX 发布 0.7.1.dev1 开发版,为 Apple Silicon 本地推理带来多项更新:
- 提速数据:Qwen3.6-35B-A3B 在 M5 Max 上解码从 156 提到 205 tok/s(+31%);GLM-5.3-Flash 在 M3 Ultra 上 31.3 → 40.6 tok/s(+30%),融合解码内核不再仅限 M5;Qwen3.8-Flash-Next 配合 expert offload,32K prefill 达 636 tok/s(+61%)。
- 批量 prefill:并发请求的 prompt 共享一次前向计算,8 个并发请求的首 token 时间从 7.41s 降到 5.75s(-22%)。
- 决策模型:新增 /v1/systemone 端点,支持 Clef、Clef-Flash 和 OpenJev 等决策模型,对类型化问题直接输出各选项概率而非生成文本,自动检测模型类型,并提供了现成的量化 checkpoint。
- Web UI 也做了刷新,支持 macOS 15 及以上。
「Infra」频道最新
- 美光并未空手而归:传闻称其仍拿到部分 Rubin HBM 订单 — suchenzang · 2026-10-10
- System 1 ANE:在苹果神经引擎上毫秒级跑小型决策模型,零文本生成 — pcuenq · 2026-10-10
- Bittensor 算力租赁月报:支出增 45%,租约失败率降 32% — markjeffrey · 2026-10-10
- 微软联手英伟达加码本地 AI:Surface 新品最高 5899 美元 — MooseEfficient2151 · 2026-10-10
- 给 Grok Bot 配 pit crew:前沿模型做规划,免费模型干杂活 — alexcovo_eth · 2026-10-10
- AI 热潮变债务热潮:Oracle 5年CDS 近纪录261bp,隐含违约率20.4% — cyb3rops · 2026-10-10