Inco Splash 引擎让 Qwen3.8-27B 在 M5 Max 上跑出 144 tok/s
TheMoonMidas · x · 2026-09-19
Inco 发布开源推理引擎 Splash,专为 Apple Silicon 优化,内置 DFlash 2 draft 模型,两条命令即可运行。
- Qwen3.8-27B 在 M5 Max MacBook Pro 上达到 144 tok/s,一个月前 DFlash 2 仅 70 tok/s
- 官方称 decode 速度达 Ollama 的 3 倍、oMLX 的 2 倍;agent 扇出子 agent 时接近 4 倍
- 项目开源,定位是围绕具体模型与 Apple 芯片协同设计
所属事件:开源引擎 Inco Splash 让 Apple Silicon 大模型推理提速(2 条相关)→
「Infra」频道最新
- 美国公司悄悄换用中国开源模型,内部知识库成本降约百倍 — generativist · 2026-09-19
- 燃气轮机卖到2030年,数据中心电力设备积压长达数年 — CatAstro_Piyush · 2026-09-19
- OpenAI 与 Anthropic 竞相收购 20-30 兆瓦小数据中心,推理需求 2027 年超训练 — abhiadesai · 2026-09-19
- CoreAI Zoo 上架 App Store:iPhone 本地跑 Qwen/Gemma 等开源模型 — pcuenq · 2026-09-19
- MiniMax H3 生态一周爆发:量化、加速、训练工具与创作工作流全面开花 — Just_Lingonberry_352 · 2026-09-19
- AI 集群缺电太狠,SpaceX 拟自造燃气轮机叶片提速 18 个月 — AccBalanced · 2026-09-19