开源推理引擎 Inco Splash:M5 Max 上 Qwen3.8-27B 跑到 144 tok/s

Lianhuiq · x · 2026-09-19

Inco 发布开源推理引擎 Inco Splash,围绕模型与 Apple Silicon 深度优化:在 M5 Max MacBook Pro 上将 Qwen3.8-27B 跑到 144 tok/s。官方对比数据显示解码速度最高达 Ollama 的 3 倍、oMLX 的 2 倍,在 agent 扇出子 agent 场景下接近 4 倍。对本地部署 Apple 芯片推理的用户值得关注。

所属事件:开源引擎 Inco Splash 让 Apple Silicon 大模型推理提速(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →