双 5060 Ti 实测 Qwen 27B:张量并行解码提至 46 tok/s
SellToOpen · reddit · 2026-08-28
用户分享在两张 16GB 的 RTX 5060 Ti(AM4 平台、x16+x4 通道、32GB DDR4)上用 LM Bionic 本地运行 Qwen3 27B(UD 3.0 Q4KXL)的实测:开启张量并行后平均解码速度从 28 tok/s 提升到 46 tok/s,但 prefill 从 1000+ tok/s 降至约 700 tok/s。
测试 prompt 约 20k token,包含写 800 字内燃机原理、生成 Flappy Bird HTML 游戏代码、总结维基百科文章三项任务,推理等级默认 xhigh。三类任务速度分别约为 22、80-90、24 tok/s。
同时开启了 MTP投机解码(max draft tokens 6,概率 0.88),草稿接受率 93.76%(9776/10427),平均长度 5.10。作者称自己是本地 LLM 新手,发帖既供参考也希望有人指出配置问题。
「Infra」频道最新
- 开源 Discord AI 助手 Zauq:支持多模型路由与 Docker 沙箱 — rar_file-exe · 2026-08-28
- 数据中心暴利让电力公司拟降费,用户年省百美元 — bennash · 2026-08-28
- 为什么本地 LLM 感觉比云端更笨?技术细节全解析 — JeremyCMorgan · 2026-08-28
- 爆料称 GTA VI 游戏本体容量将介于 748GB 至 2TB 之间 — PtrPomorski · 2026-08-28
- 仅耗时 5 小时即可本地运行前沿 AI 模型 — MaziyarPanahi · 2026-08-28
- Qwen3.8 Flash Next 本地部署参数与性能测试分享 — Motor_Ad16 · 2026-08-28