硬核移植:将 Ninfer 移植至 CMP 170HX,Qwen 性能翻倍
ubrtnk · reddit · 2026-08-23
作者分享了将 Ninfer (高性能推理引擎) 移植到 CMP 170HX 数据中心显卡的过程,并实现了显著的性能提升:
- 背景:RTX 3090 与 CMP 170HX 架构相近,作者利用 AI 辅助完成了代码移植工作。
- 技术挑战:解决了 SM 数量差异(70 vs 82)导致的 cudaErrorCooperativeLaunchTooLarge 错误,动态调整 split-K 调度策略,并移除了 Blackwell 专用内核与 CUDA 前向兼容库依赖。
- 成果:在 Qwen3.6-35B 模型上实现了 2 倍性能提升,支持 262K 上下文且显存占用合理(Int8 KV Cache)。
提供了详细的 Docker 运行配置与 llama-swap 集成方案。
「Infra」频道最新
- 数据中心反对声浪与 AI 行业扩张的矛盾 — NathanpmYoung · 2026-08-23
- RTX A6000 换硅脂装风扇,我终于敢跑模型了 — cephaloform · 2026-08-23
- 大神为 AMD GFX906 显卡优化了 llama.cpp — milpster · 2026-08-23
- Nvidia AI 服务器涨价超 15%,GB300 售价约 60 万美元 — zephyr_z9 · 2026-08-23
- ROCM 在 Windows 平台上的生成速度是否值得切换? — Low-Location5266 · 2026-08-23
- AI 算力非黄金,GPU 贬值快致金融衍生品失效 — AccBalanced · 2026-08-23