Qwen3.8-27B 优化实录:速度飙升至 153 tok/s

TrifleHopeful5418 · reddit · 2026-08-21

作者通过 159 次实验,在 AMD Strix Halo (128GB) + RTX 3090 Ti 的异构配置下,将 Qwen3.8-27B 的生成长文本速度从 9.5 tok/s 提升至 153 tok/s(32K 代码上下文),并在 HumanEval 上跑赢双 3090 vLLM 集群。

核心优化手段:

避坑指南:

实测结果:

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →