RTX 5060 Ti 16GB 本地跑 Qwen2.5-14B 实测:生成速度达 44 t/s
Primary_Olive_5444 · reddit · 2026-08-13
一位开发者在 RTX 5060 Ti 16GB 显卡上本地运行 Qwen2.5-14B-Instruct(Q4KM 量化版本),分享了具体的性能数据:
- 处理速度:Prompt 处理速度达到 667.8 t/s,生成速度为 44.0 t/s。
- 运行参数:上下文长度设置为 32768,并启用了全部 GPU 层(-ngl 99)。
- 优化探讨:发帖者认为硬件仍有余量,寻求进一步提升 Token 吞吐量的方法,并希望社区推荐适合该 16GB 显存硬件的最新开源模型。
「Infra」频道最新
- 英伟达高管:银行 AI 优势源于自有数据与基础设施 — marc_stampfli · 2026-08-13
- Hugging Face 新研究:LLM Agent 调度机制优化 GPU 资源 — Josef Liyanjun Chen · 2026-08-13
- 纯C++无Python:vllm.cpp开源推理栈进展与多硬件适配 — pbaylies · 2026-08-13
- Google高管:7年前的TPU仍保持100%利用率 — rohanpaul_ai · 2026-08-13
- RTX 4070 跑 MiniMax H3 视频生成:加速方案让渲染快 3 倍 — Fun_Walk_4965 · 2026-08-13
- 探讨在 Blackwell 架构上部署 DeepSeek 的量化方案 — Best_Sail5 · 2026-08-13