35B MoE 压进 7GB:Mach-1 发布 GGUF 与 llama.cpp fork
pmttyji · reddit · 2026-08-20
SyzygyResearch 发布了 Mach-1-Additive-35B 的 GGUF 量化版及配套的 llama.cpp 定制 fork:这个 35B 参数的 MoE 模型仅需约 7GB 存储,适合手机、边缘设备与低内存系统,在普通消费级笔记本上速度可达 120 tokens/s。
- GGUF 仓库:基础版与 Multimodal 多模态版各一个
- 定制 fork:github.com/SyzygyResearch/llama.cpp-mach1
- 官方此前预告 Laguna S2.1 与 Qwen 3.8 即将推出
发帖人同时维护着一个 1-bit / 2-bit / Ternary / Bitnet 低比特模型的跟踪帖,可关注同类进展。
「Infra」频道最新
- S3 细节缺失引主权担忧,欧盟亟需自建云存储对手 — mgill25 · 2026-08-20
- 浪潮发布元脑AIWork一体机,统一纳管企业Agent与Token — 智东西 · 2026-08-20
- Callosum 融资 1 亿美元,构建异构 AI 计算平台 — _rockt · 2026-08-20
- 求助:如何搭建纯内网文档 AI Agent — Remarkable_Mine_1622 · 2026-08-20
- Trail Mate:基于 LoRa 的离线 GPS 导航手持系统 — tom_doerr · 2026-08-20
- Omarchy 与 Linux 桌面:AI 助力的机遇 — antirez · 2026-08-20