开源推理引擎 Inco Splash:M5 Max 上 Qwen3.8-27B 跑到 144 tok/s
Lianhuiq · x · 2026-09-19
Inco 发布开源推理引擎 Inco Splash,围绕模型与 Apple Silicon 深度优化:在 M5 Max MacBook Pro 上将 Qwen3.8-27B 跑到 144 tok/s。官方对比数据显示解码速度最高达 Ollama 的 3 倍、oMLX 的 2 倍,在 agent 扇出子 agent 场景下接近 4 倍。对本地部署 Apple 芯片推理的用户值得关注。
所属事件:开源引擎 Inco Splash 让 Apple Silicon 大模型推理提速(2 条相关)→
「Infra」频道最新
- CoreAI Zoo 上架 App Store:iPhone 本地跑 Qwen/Gemma 等开源模型 — pcuenq · 2026-09-19
- MiniMax H3 生态一周爆发:量化、加速、训练工具与创作工作流全面开花 — Just_Lingonberry_352 · 2026-09-19
- AI 集群缺电太狠,SpaceX 拟自造燃气轮机叶片提速 18 个月 — AccBalanced · 2026-09-19
- 博主本地实测 27B 新模型 Bansai,仅需 5GB 内存 — draginol · 2026-09-19
- Inco Splash 引擎让 Qwen3.8-27B 在 M5 Max 上跑出 144 tok/s — TheMoonMidas · 2026-09-19
- 新研究:模型增长架构省 20 倍算力,权重共享并非算力最优 — burny_tech · 2026-09-19