实测 Qwen3.8-Flash-Next FP8:双卡实现 52.4 万上下文
SpendLucky1273 · reddit · 2026-08-29
作者成功在 2 张 RTX PRO 6000 (Ada) 上运行 Qwen3.8-Flash-Next FP8,实现了 524K 上下文。
核心配置:
- TP2 + EP2, MTP3, PLE CPU offload;
- YaRN 2x 扩展上下文;
- 关键参数:--max-model-len 524288。
遇到的问题与修复:
- 扩展至 524K 时,目标模型正确切换,但 MTP draft 模型仍停留在 262K,导致缓存几何验证失败;
- 修复方法:Patch Qwen3.8 MTP 配置,使 draft 继承 target 的 maxmodellen。
当前状态:KV Cache 大小 654,980 tokens,并发 1.25x,DeepGEMM FP8 MoE 后端自动启用。
「Infra」频道最新
- 拆解 LLM Prefill 与 Decode 分离:硬件不同结果迥异 — vllm_project · 2026-08-29
- a16z 筹集 11 亿美元「机器时代」基金,重注 AI 基础设施 — JenniferHli · 2026-08-29
- 升级推理引擎获 43% 提速,架构实现是关键 — colinmcnamara · 2026-08-29
- 开发者争论 CUDA 与 JIT DSL 的权衡与陷阱 — YouJiacheng · 2026-08-29
- Microsoft Fabric 变量库详解:消除硬编码与配置管理痛点 — adnan_hashmi · 2026-08-29
- Ollama 推出 Claude 集成,支持桌面版运行本地模型 — dr_cintas · 2026-08-29