RTX 3090 24G 单卡跑 Qwen3.8 27B INT4,144K 上下文 71/75 评测
Altruistic_Heat_9531 · reddit · 2026-09-14
Reddit 用户分享在单张 RTX 3090(24GB)上用 vLLM 跑 Qwen3.8-27B INT4(AutoRound 权重)+ FP8 E4M3 KV cache 的完整配方,上下文达 147,456 tokens,超过 llama.cpp 的 25-30 tok/s 方案。
关键经验
- JIT 编译 OOM 时改用 AOT(Ahead-of-Time)编译,首次 OOM 后重试一次可能因已缓存部分编译产物而成功
- 编译缓存测试多轮配置后可达 5-6GB,建议删除旧缓存重跑最终配置两次
- 上下文从 32K 逐步试到 144K(实际上限约 154K),batch size 从 256 爬到 1024
- GDN/线性注意力下 vLLM 对 KV 与 state-cache 显存预估不准,需 --mamba-cache-mode align
关键参数:--gpu-memory-utilization 0.9475、--kv-cache-dtype fp8e4m3、--max-num-seqs 1、--enable-prefix-caching、--enable-chunked-prefill、--language-model-only,vLLM 0.27.1 + Club 3090 补丁。
评测:用 BenchLocal 75 场景(工具调用/指令遵循/结构化输出/数据抽取/推理数学)跑分 71/75(94.7%),reasoningeffort=low、INT4 权重下达成,全程约 15 分钟。完整命令与基准脚本均已开源。
「编程与Agent」频道最新
- OpenViking 开源:为 AI Agent 打造的上下文数据库 — adnan_hashmi · 2026-09-14
- 用 APFS/btrfs 等文件夹克隆,git worktree 创建速度提升约 80% — steipete · 2026-09-14
- 开发者用一个 20x 订阅狂调 AWS 故障,烧掉约八成额度 — generativist · 2026-09-14
- 微软 AgentRx 论文:定位 50 步 Agent 轨迹中的真正故障源头 — JohnAlexander · 2026-09-14
- 用环境变量把子代理切到 Opus,大幅省下高级模型用量 — lydiahallie · 2026-09-14
- 用橄榄球讲透 Agent 架构:QB 主智能体、WR 当工具 — philipkiely · 2026-09-14