RTX 5090 跑 Qwen3.8-27B:vLLM 与新秀 ninfer 该怎么选

MaxKingCS · reddit · 2026-08-31

Reddit 用户目前在 RTX 5090 上用 vLLM 跑 unsloth/Qwen3.8-27B-NVFP4(157k 上下文),近期看到不少帖子称 ninfer 是在 5090 上跑 Qwen3.8 的最佳方案,想了解实际体验对比。他还发现 Hugging Face 上的 gittensor-model-hub/Qwen3.8-27B-NVFP4-RTX5090 量化版本声称比 unsloth 版上下文更长、性能更好,但未经验证,觉得有些可疑。此外还想了解配合 Hermes agent 等 agent harness 使用的最佳配置。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →