NInfer 实测:Qwen3.6 预填充速度提升超 2 倍

tat_tvam_asshole · reddit · 2026-08-01

一位开发者在 RTX Pro 6000(限制 420W)上对比了 NInfer(NVFP4)与 llama.cpp(Q4KXL)运行 Qwen3.6-27B 模型的性能差异。

作者指出,NInfer 主要针对 sm120 架构(如未来的 5090)优化,此次测试旨在补充社区数据。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →