本地推理工具 Splash 1.1.0 发布:支持 GGUF 量化与 MLX 导入,M5 上 27B 跑 50 t/s
wojtek15 · reddit · 2026-09-27
本地推理工具 Splash 发布 1.1.0,新增 GGUF 量化模型支持和 MLX 导入等功能。作者在 M5 Pro 64GB 上以 Unsloth UD-Q4KXL 量化跑 Qwen3 27B,在 agentic 工作流中能以约 50 tokens/s 的速度稳定工作。
作者认为 Splash 把优化 kernel、投机解码、前缀缓存和混合权重支持整合在一个程序里,是 Apple Silicon 本地推理的一个突破。
「Infra」频道最新
- 英国电网供电不足,大型 AI 项目恐延误数年 — rvp · 2026-09-27
- FT:OpenAI 预计 2026-2030 自由现金流为负 2780 亿美元 — Beth_Kindig · 2026-09-27
- IIT 德里宣布设计出印度首款自主 micro-GPU — rvp · 2026-09-27
- 马斯克预测中国约 2-3 年内解决算力与光刻难题 — haider1 · 2026-09-27
- 开发者吐槽:99% 场景下 Vercel 已不划算,agents 可安全用 Cloudflare — generativist · 2026-09-27
- ZeroHedge 算 GPU 收益账被指用错吞吐,低估 8-10 倍 — zephyr_z9 · 2026-09-27