RTX 5070 Ti 笔电实测 Qwen 27B:4.5 tok/s

CoffeeToCode99 · reddit · 2026-08-15

在配备 12GB RTX 5070 Ti 笔记本 GPU 上运行 Qwen3.8-27B (UD-Q4KXL),结合 CPU 卸载与 MTP 推测解码,实现了约 4.5 tok/s 的生成速度,MTP 接受率约为 80%。实测表明该配置下模型运行稳定,适用于对质量要求高于速度的场景,且能正常进行事实问答和 Python 编码。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →