实测 RTX 5090 跑 Qwen3.8 27B:长上下文速度依然稳定
_-_David · reddit · 2026-08-18
基于 RTX 5090 对 Qwen3.8 27B 模型进行了 7 小时的连续测试(1274 次生成),记录了不同 Prompt 大小下的解码速度中位数:
| Prompt 大小 | 解码速度 |
| :--- | :--- |
| <50k | 169.7 tok/s |
| 50–100k | 167.6 tok/s |
| 100–150k | 156.9 tok/s |
| 150–200k | 149.0 tok/s |
| 200k+ | 143.7 tok/s |
亮点数据:
- 单次请求最大解码速度:222.0 tok/s
- 持续 5 秒间隔最大解码:211.2 tok/s
- 配置:KV cache 设为 q8,上下文长度最大,无超频/降压。
「Infra」频道最新
- Merge 与 Mastra 合作,为 AI Agent 提供统一 API 网关 — shensi · 2026-08-18
- OCP 硅光架构愿景被吐槽:每 token 能耗逼近 1 焦耳 — jwt0625 · 2026-08-18
- OpenRouter 年度 token 用量从 3.73T 暴涨至 75T 以上 — scaling01 · 2026-08-18
- 传 Crusoe 寻求 IPO,估值或达 350 亿美元 — nwilliams030 · 2026-08-18
- MiniMax H3 动态工作流:16GB 显存跑 4 秒步数 — DaExChef · 2026-08-18
- ComfyUI 更新后 MiniMax H3 生成质量严重下降 — ASK_ABT_MY_USERNAME · 2026-08-18