lithos-metal 内核在 M5 上实测快于 Ollama,作者称深度调优 M5 Max
JiaZhihao · x · 2026-10-09
作者 JiaZhihao 确认其开源 megakernels 项目 lithos-metal 目前针对 M5 Max 深度调优,正在为 M5 Pro 优化。用户实测在 M5 Pro 上运行 Qwen3 27B 时,预热后 lithos 明显快于 Ollama,但也指出推理速度与服务体验是两个问题:其实际工作流(本地语音输入法,固定 5.6K token 系统提示、每轮仅 15-90 输出 token、贪心解码)更在乎首字延迟与模型保温/闲置卸载,而非长文吞吐,Ollama 在功能层面仍有优势。
「Infra」频道最新
- TokenRouter 实现 token 级 LLM 路由服务,解码吞吐提升最高 64 倍 — nics-efc · 2026-10-09
- SparseDecoding 解码感知剪枝:对齐生成分布,A100 解码提速至 1.48 倍 — encodelab · 2026-10-09
- Arduino VENTUNO Q 上用 FEX 跑 x86 版 Edge,还有 GPU 加速 — unixterminal · 2026-10-09
- Edge0 开源月余:35B 模型 iPhone 飞行模式运行,峰值内存仅 1.8GB — FinanceYF5 · 2026-10-09
- 免依赖 CLI 直接跑 Qwen Image 2.1 与 MiniMax H3,模型自动下载 — TracerBulletX · 2026-10-09
- llm-tune 开源:一键为本地 LLM 找最优量化与推理参数 — Distinct-Pie2389 · 2026-10-09