Qwen3.8-27B Inference Optimized for RTX 3090

Developers released highly optimized inference for Qwen3.8-27B on a single RTX 3090, leveraging fp16 recurrent states, full-layer int8 activations, and draft vocabulary tricks to reach up to 124 TPS with greedy sampling.

2026-08-18 ~ 2026-08-19 · 2 related posts

Full story(13 episodes)→