本地推理工具 Splash 1.1.0 发布:支持 GGUF 量化与 MLX 导入,M5 上 27B 跑 50 t/s

wojtek15 · reddit · 2026-09-27

本地推理工具 Splash 发布 1.1.0,新增 GGUF 量化模型支持和 MLX 导入等功能。作者在 M5 Pro 64GB 上以 Unsloth UD-Q4KXL 量化跑 Qwen3 27B,在 agentic 工作流中能以约 50 tokens/s 的速度稳定工作。

作者认为 Splash 把优化 kernel、投机解码、前缀缓存和混合权重支持整合在一个程序里,是 Apple Silicon 本地推理的一个突破。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →