RTX 3090 24G 单卡跑 Qwen3.8 27B INT4,144K 上下文 71/75 评测

Altruistic_Heat_9531 · reddit · 2026-09-14

Reddit 用户分享在单张 RTX 3090(24GB)上用 vLLM 跑 Qwen3.8-27B INT4(AutoRound 权重)+ FP8 E4M3 KV cache 的完整配方,上下文达 147,456 tokens,超过 llama.cpp 的 25-30 tok/s 方案。

关键经验

关键参数:--gpu-memory-utilization 0.9475、--kv-cache-dtype fp8e4m3、--max-num-seqs 1、--enable-prefix-caching、--enable-chunked-prefill、--language-model-only,vLLM 0.27.1 + Club 3090 补丁。

评测:用 BenchLocal 75 场景(工具调用/指令遵循/结构化输出/数据抽取/推理数学)跑分 71/75(94.7%),reasoningeffort=low、INT4 权重下达成,全程约 15 分钟。完整命令与基准脚本均已开源。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →