RTX 3090 上 Qwen3.8-27B 推理提速至 381 tps

iamMess · reddit · 2026-08-21

作者分享了其 Qwen3.8-27B 推理引擎的最新优化成果,在 RTX 3090 上实现了 382 tps 的文档复现速度。关键优化包括:

作者诚实地修正了之前的测试数据,指出量化缓存会导致 MTP 接受率下降(从 2.56 降至 2.38),导致长文本下解码开销增加 2.13 倍。该模式适用于 RAG 和代码编辑等高频引用场景,而非通用对话。

所属事件:RTX 3090 上 Qwen3.8-27B 推理提速至 381 TPS(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →