RTX 3090 上 Qwen3.8-27B 推理提速至 381 TPS

开发者持续优化 Qwen3.8-27B 在 RTX 3090 上的推理性能,先是将默认采样下的速度推至 134 TPS,并将长对话多轮响应延迟从 23 秒降至约 1 秒;随后通过加长验证块等优化,进一步将文档复现速度提升至 381 TPS 左右,显著改善了消费级显卡运行大模型的体验。

2026-08-20 ~ 2026-08-21 · 2 条相关

事件全程(共 13 集)→