RTX 3090 优化运行 Qwen3.8-27B 推理速度提升

用户在 RTX 3090 上运行 Qwen3.8-27B 量化版,速度达 34-36 tokens/s,显著高于此前版本。开发者通过移植 NInfer 运行时、启用 ReplaySSM 技术及优化 CUDA 图表,提升了运行效率。此外,社区还发布了针对双 3090 优化的 INT8 量化版。

2026-08-15 ~ 2026-08-15 · 3 条相关

事件全程(共 10 集)→