双 5060 Ti 实测 Qwen 27B:张量并行解码提至 46 tok/s

SellToOpen · reddit · 2026-08-28

用户分享在两张 16GB 的 RTX 5060 Ti(AM4 平台、x16+x4 通道、32GB DDR4)上用 LM Bionic 本地运行 Qwen3 27B(UD 3.0 Q4KXL)的实测:开启张量并行后平均解码速度从 28 tok/s 提升到 46 tok/s,但 prefill 从 1000+ tok/s 降至约 700 tok/s。

测试 prompt 约 20k token,包含写 800 字内燃机原理、生成 Flappy Bird HTML 游戏代码、总结维基百科文章三项任务,推理等级默认 xhigh。三类任务速度分别约为 22、80-90、24 tok/s。

同时开启了 MTP投机解码(max draft tokens 6,概率 0.88),草稿接受率 93.76%(9776/10427),平均长度 5.10。作者称自己是本地 LLM 新手,发帖既供参考也希望有人指出配置问题。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →