RTX 5070 Ti 笔电实测 Qwen 27B:4.5 tok/s
CoffeeToCode99 · reddit · 2026-08-15
在配备 12GB RTX 5070 Ti 笔记本 GPU 上运行 Qwen3.8-27B (UD-Q4KXL),结合 CPU 卸载与 MTP 推测解码,实现了约 4.5 tok/s 的生成速度,MTP 接受率约为 80%。实测表明该配置下模型运行稳定,适用于对质量要求高于速度的场景,且能正常进行事实问答和 Python 编码。
「Infra」频道最新
- Tobi 开源 walgit:无数据库的单二进制 Git 服务器 — jevon · 2026-08-24
- s3collections:用S3构建分布式系统持久化数据结构 — andersonbcdefg · 2026-08-24
- 预测市场:年底前美一州实施数据中心禁令概率 68% — Polymarket · 2026-08-24
- Ramp 用本地模型省钱,引发业界对 AI 成本反思 — annetgriffin · 2026-08-24
- GitHub Actions 额度耗尽,是时候迁移到自建 VPS 了吗? — MicahBerkley · 2026-08-24
- Ubuntu 计划成为 RISC-V CPU 的参考操作系统 — bookwormengr · 2026-08-24