125B Qwen3.8-Flash-Next 在迷你 PC 跑出 59 tok/s,推理引擎开源
Yaniss916 · reddit · 2026-10-05
Yamz 团队让 125B MoE(6B 激活)的 Qwen3.8-Flash-Next 在单台 AMD Strix Halo 迷你主机(Ryzen AI Max+ 395, 128GB)上流畅运行,并开源了 95GB EXL3 权重与基于 ExLlamaV3 的推理引擎 Kyojin。
- 速度:投机解码下 44-59 tok/s(聊天约 47、代码约 58);无投机解码 32.7 tok/s。对比同机 llama.cpp 用户约 30 tok/s、500 tok/s prefill。
- Prefill:4K 约 1412 tok/s,且 128K 长上下文仍保持约 32 tok/s;64K/128K 海针测试 10/10。
- 保真度:与原 FP8 模型 top-1 一致率 94.1%,高于竞品 Halogen 的 92.3%,KL 散度低 41%;但 Halogen 0.16.2 整体更快,团队正重写引擎核心追赶。
- 投机解码严格保证输出 token 与普通解码完全一致;另有关闭的 uncensor 预设,重度工具调用场景建议不开。
「Infra」频道最新
- 英伟达 Dynamo 支持把编码智能体直连自托管端点,内置追踪回放 — TheZachMueller · 2026-10-06
- Schmidhuber:每 5 年算力便宜 10 倍,25 年后便宜 10 万倍 — SchmidhuberAI · 2026-10-06
- 马斯克确认台积电正洽谈合作,为其德州 Terafab 建芯片 — Polymarket · 2026-10-06
- 12GB显卡本地跑MiniMax H3做电影预告片:0.6MP+4:3是甜点 — vortis23 · 2026-10-06
- AI数据中心扩张撞上电网天花板,多个规划项目被迫撤回 — DavidLinthicum · 2026-10-05
- 麒麟 9050 传用 1.5 微米 HBI 封装,分析师称量产才是真正难关 — teortaxesTex · 2026-10-05