实测 Qwen3.8-Flash-Next FP8:双卡实现 52.4 万上下文

SpendLucky1273 · reddit · 2026-08-29

作者成功在 2 张 RTX PRO 6000 (Ada) 上运行 Qwen3.8-Flash-Next FP8,实现了 524K 上下文。

核心配置:

遇到的问题与修复:

当前状态:KV Cache 大小 654,980 tokens,并发 1.25x,DeepGEMM FP8 MoE 后端自动启用。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →