Sushi 量化引擎发布 2.6bpw 极限量化,Qwen3.8 43.8GB 塞进 64GB Mac
alexcovo_eth · x · 2026-09-28
Sushi 是一个面向 Apple Silicon 的自定义推理引擎(mlx-serve 的 fork),专注于用自研「sushi 量化」格式在 M5 Max 级芯片上运行选定模型,混合 EXL3 与 affine 量化格式。
- 最新发布 Qwen3.8-Flash-Next-Sushi-2.6bpw,权重仅 43.8GB,是目前最小的 sushi 量化版本,64GB 内存的机器即可本地运行
- 另有 3bpw(需 64GB+)和 4bpw(需 96GB+)版本
- 开源在 GitHub,可独立运行也可作为 mlx-serve 的客座引擎,演示中已在本地生成内容
「Infra」频道最新
- 一个驱动开关让 AMD 双卡 Vulkan 推理提速最高 4 倍 — tabletuser_blogspot · 2026-09-28
- PrismML 三值压缩 Qwen3.8 27B 至 5.9GB,能力保留 98.2% — dl_weekly · 2026-09-28
- 开发者拟让 Codex 决定跑哪些测试,大幅削减 CI 成本 — sull · 2026-09-28
- 免费在线 LLM 原理全指南:从 token 到本地部署全链路 — JFPuget · 2026-09-28
- 向量数据库够用吗?Reddit 热议 Agent 生产级存储难题 — OkShirt9372 · 2026-09-28
- GPU 多到没处用:有人用 PTX 当词表预训练了一个基础模型 — rickasaurus · 2026-09-28