35B MoE 压进 7GB:Mach-1 发布 GGUF 与 llama.cpp fork

pmttyji · reddit · 2026-08-20

SyzygyResearch 发布了 Mach-1-Additive-35B 的 GGUF 量化版及配套的 llama.cpp 定制 fork:这个 35B 参数的 MoE 模型仅需约 7GB 存储,适合手机、边缘设备与低内存系统,在普通消费级笔记本上速度可达 120 tokens/s。

发帖人同时维护着一个 1-bit / 2-bit / Ternary / Bitnet 低比特模型的跟踪帖,可关注同类进展。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →