单卡 RTX 5080 跑 35B 模型:从 llama.cpp 迁移至 vLLM 指南

McFlurriez · reddit · 2026-08-11

一位开发者正在寻求将本地大模型推理从 llama.cpp 迁移到 vLLM 的建议。目前他在单张 RTX 5080 显卡上使用 llama.cpp 运行 Qwen3.6-35B-A3B 模型,需要将部分层卸载到 CPU,且仅支持单路并发(-np 1)。

为了配合其编码工具中的子智能体功能,他希望切换到对并发请求支持更好的 vLLM,但面临配置复杂的问题。他特别询问如何在 vLLM 中实现类似 llama.cpp 中 -ncmoe 20(针对 MoE 模型的专家卸载设置)的功能。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →