177B 的 Qwen3.8 Flash Next 在 128GB Strix Halo 上跑出 45 tps 解码

deepu105 · reddit · 2026-10-08

Reddit 用户 deepu105 分享用 Halogen 0.17.2 搭配 Qwen 3.8 Flash Next 在 128GB Strix Halo 上的本地推理体验:即使在长上下文下,解码速度也稳定在约 45 tps,对约 177B 参数的模型来说表现相当惊人。作者还提到用 QFN 实现并审查 Opus 5.5 的 plan 质量很高,认为社区对这个模型的本地部署能力还没有足够重视。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →