单台 128GB Strix Halo 跑 300B 级 MoE:Kyojin 引擎实测 GLM 26-30 tok/s
Yaniss916 · reddit · 2026-10-03
Yamz-Labs 发布 Kyojin 引擎(基于 ExLlamaV3,面向 AMD Strix Halo / gfx1151 的 ROCm),让两台 128GB 的 Ryzen AI Max+ 395 迷你主机各装一个 300B 级 MoE 模型:
- GLM-5.3-Flash(99.7GB EXL3):3.5K 上下文 prefill 580 tok/s,64K 时 546 tok/s;decode 26-30 tok/s(MTP)。
- MiMo-V2.6-Flash-MOPD(105GB,自家量化):prefill 650 tok/s @4K;decode 普通 29 tok/s,投机解码下代码 44 / 对话 35 tok/s。
- 质量指标:与官方 FP8 相比 KLD 分别 0.151 / 0.0713,top-1 一致率 89.3% / 92.0%。作者自配的 GLM 层混合比 turboderp 公开的 2.05bpw 包 KLD 更低(0.190 vs 0.275),但后者更小且 decode 快约 10%。
- 另有 -Uncensored 变体(加载时应用一个小文件,可一键关闭)。
- 快速上手:clone + ./build.sh + hf download + serve.py,提供 OpenAI 风格 API。引擎开源,权重在 HF,欢迎其他 Strix Halo 用户提交 tok/s 数据与 PR。
「Infra」频道最新
- 开源 Strata:12GB 显存家用机跑通 1250 亿参数 Qwen 模型 — lxfater · 2026-10-03
- 芯片设计组合空间达 10^260 万,AI 与 agents 把硬件变成搜索问题 — ai · 2026-10-03
- Redis 作者 antirez 发布 DwarfStar 4:MIT 许可本地推理引擎,KV 缓存可落盘 — petrusenko_max · 2026-10-03
- 899 美元 Mac Mini M6 被当上网本,其实是 24 小时 agentic 计算机器 — hey_abusiddik · 2026-10-03
- Modal VM 沙箱正式 GA:一套流程跑起 Docker Compose 应用、测试与编码 Agent — charles_irl · 2026-10-03
- 793 人社区投票:oMLX 以 55.5% 成最受欢迎的 Apple MLX 引擎 — HankYeomans · 2026-10-03