RTX 5090 Benchmarks Qwen3.8 27B: Stable Speed at Long Context
_-_David · reddit · 2026-08-18
Real-world performance data for Qwen3.8 27B on an RTX 5090 based on 7 hours of continuous testing (1,274 generations). Median decode speeds remained surprisingly stable as context grew:
| Prompt Size | Decode Speed |
| :--- | :--- |
| <50k | 169.7 tok/s |
| 50–100k | 167.6 tok/s |
| 100–150k | 156.9 tok/s |
| 150–200k | 149.0 tok/s |
| 200k+ | 143.7 tok/s |
Peak Metrics:
- Max Decode (Single Request): 222.0 tok/s
- Max Decode (Sustained): 211.2 tok/s
- Config: KV cache set to q8, max context length, stock clocks.
More from Infra
- Nvidia Backs OpenAI's Ohio AI Data Center With up to $105B Guarantee — 创业邦 · 2026-08-18
- OCP's Silicon Photonics Vision Roasted as Per-Token Energy Nears 1 Joule — jwt0625 · 2026-08-18
- OpenRouter token usage exploded from 3.73T to over 75T in one year — scaling01 · 2026-08-18
- Crusoe in IPO Talks with Banks, Valued at $35B in Fundraise — nwilliams030 · 2026-08-18
- MiniMax H3 Dynamic Workflow: Running on 16GB VRAM with 4-sec Steps — DaExChef · 2026-08-18
- MiniMax H3 Quality Degrades After ComfyUI Update — ASK_ABT_MY_USERNAME · 2026-08-18