RTX 3090 跑 27B 大上下文实测:131K 上下文约 25.6 tok/s
bjivanovich · reddit · 2026-09-09
作者分享在单卡 RTX 3090(24GB)+ Xeon E5-2670 v3 + 48GB 内存上运行 Huihui Qwen3.8-27B Abliterated(Q4KS,KV cache 量化为 Q4)的实测数据:
- 131072 上下文:对话已用 111797 token(85.3%),显存占用 23.5/24GB,首次运行 22.02 tok/s 但 TTFT 高达 303 秒;后续运行平均约 25.58 tok/s,TTFT 4.750 秒不等
- 196608 上下文:平均 25.80 tok/s,但冷启动预填充可达 514 秒
- 平均 DTA(生成中占比)约 64.57%
结论:24GB 消费卡靠 Q4 KV cache 能撑起 128K192K 的大上下文,吞吐稳定在 25 tok/s 左右,代价是首次预填充等待极长。
「Infra」频道最新
- 人形机器人革命缺电机:现役仅500-600亿美元,还需2500亿 — stepjamUK · 2026-09-09
- Google Cloud 详解四种开源模型部署方案,成本与控制权取舍 — rseroter · 2026-09-09
- Signal65 建模:本地跑 Agent 工作负载最快 2.1 个月回本 — ryanshrout · 2026-09-09
- Spotify 开源 Portal 插件,号称把 Claude Code 成本砍 90% — fsharpman · 2026-09-09
- 播客拆解 AI 芯片瓶颈:补 GPU 没用,基板与封装才是 2027 硬约束 — BenBajarin · 2026-09-09
- 浏览器里跑 27B 1-bit 模型:6GB 3060 笔记本达 25-30 tok/s — mentria-ai · 2026-09-09