177B 的 Qwen3.8 Flash Next 在 128GB Strix Halo 上跑出 45 tps 解码
deepu105 · reddit · 2026-10-08
Reddit 用户 deepu105 分享用 Halogen 0.17.2 搭配 Qwen 3.8 Flash Next 在 128GB Strix Halo 上的本地推理体验:即使在长上下文下,解码速度也稳定在约 45 tps,对约 177B 参数的模型来说表现相当惊人。作者还提到用 QFN 实现并审查 Opus 5.5 的 plan 质量很高,认为社区对这个模型的本地部署能力还没有足够重视。
「Infra」频道最新
- 企业 AI 走向模型路由:最小够用模型比最强模型更划算 — ingliguori · 2026-10-08
- 众测本地编码 Harness:3090 凭 qwen3.8-flash-next 配置击败 5090 — dh7net · 2026-10-08
- llama.cpp 支持异构设备分布式推理,GPU+笔记本跑满 40 tokens/s — joao_gante · 2026-10-08
- Java 推理框架 jitLLM 宣称达 llama.cpp 90% GPU 性能 — mikebmx1 · 2026-10-08
- 台湾封测厂 9 个月下单 110 亿美元设备,超 2019-2025 总和 — zephyr_z9 · 2026-10-08
- NVIDIA 官宣 GTC 柏林:黄仁勋 10 月 21 日发表主题演讲 — GavinSBaker · 2026-10-08