Qwen 3.8 27B NVFP4 量化版在双 V100 NVLink 上跑通 40 万上下文
jjusko20 · reddit · 2026-09-17
Reddit 用户分享 Qwen 3.8 27B NVFP4 量化模型在 2x V100 32GB(NVLink 互联)上的运行基准,配合 dflash2 注意力实现,总上下文达到约 40 万 token,并附评测截图。对于用旧卡跑长上下文的本地部署玩家有参考价值。
「Infra」频道最新
- 强化学习训练成本基准上线,高级 RL 费用首次有参照 — teortaxesTex · 2026-09-17
- PyTorch 大会公布议程:torch.compile 与自定义内核成焦点 — PyTorch · 2026-09-17
- 借助「结构化决策」思路把 DiffusionGemma 推理提速 3-10 倍 — bodonoghue85 · 2026-09-17
- MTS 发布 AI 算力栈交互式图解:从电网到芯片 rack 五层全拆解 — dr_alphalyrae · 2026-09-17
- llama.cpp 跑 Qwen3.8-Flash-Next 的 SSD N-gram 流式参数求助 — Ambitious_Fold_2874 · 2026-09-17
- 贝尔实验室如何错失微芯片:IEEE Spectrum 复盘一段技术史教训 — ArtificialOther · 2026-09-17