单卡 RTX 5080 跑 35B 模型:从 llama.cpp 迁移至 vLLM 指南
McFlurriez · reddit · 2026-08-11
一位开发者正在寻求将本地大模型推理从 llama.cpp 迁移到 vLLM 的建议。目前他在单张 RTX 5080 显卡上使用 llama.cpp 运行 Qwen3.6-35B-A3B 模型,需要将部分层卸载到 CPU,且仅支持单路并发(-np 1)。
为了配合其编码工具中的子智能体功能,他希望切换到对并发请求支持更好的 vLLM,但面临配置复杂的问题。他特别询问如何在 vLLM 中实现类似 llama.cpp 中 -ncmoe 20(针对 MoE 模型的专家卸载设置)的功能。
「Infra」频道最新
- 仅花200美元从零训练1B参数大模型,作者全开源训练细节 — SevereTilt · 2026-08-11
- AI网关与模型路由需求激增,成行业新热点 — shensi · 2026-08-11
- OpenAI 致信德州州长,阐述负责任 AI 基础设施建设愿景 — borowcy · 2026-08-11
- 实测 DGX Spark 运行 H3:ComfyUI 文生视频初探 — allaboutai-kris · 2026-08-11
- 中国首款国产前道光刻机投产,性能对标 90 年代 ASML — pstAsiatech · 2026-08-11
- 不足10%企业规模化落地AI,算力短缺将长期制约 — BenBajarin · 2026-08-11