NInfer 实测:Qwen3.6 预填充速度提升超 2 倍
tat_tvam_asshole · reddit · 2026-08-01
一位开发者在 RTX Pro 6000(限制 420W)上对比了 NInfer(NVFP4)与 llama.cpp(Q4KXL)运行 Qwen3.6-27B 模型的性能差异。
- 预填充速度:NInfer 在 8K 至 256K 上下文长度下,速度是 llama.cpp 的 2.17 至 3.53 倍。
- 生成速度:在代码和结构化 JSON 生成任务中,NInfer 分别快 1.14 倍和 1.28 倍。
- 资源占用:NInfer 在满上下文运行时节省了约 2.9GB(约 10%)的显存。
作者指出,NInfer 主要针对 sm120 架构(如未来的 5090)优化,此次测试旨在补充社区数据。
「Infra」频道最新
- a16z:智能爆炸本质是制造业爆炸,AI 基建需求未现放缓 — a16z · 2026-08-01
- 本地跑满血 DeepSeek 需要什么硬件?社区热议并发方案 — whoami-233 · 2026-08-01
- 隐性知识流失快,AI时代核电重建面临挑战 — gabriel1 · 2026-08-01
- 高通收购 Modular:剑指开放 AI 基础设施标准 — clattner_llvm · 2026-08-01
- 马斯克断言:99.99%的AI算力最终将转移至太空 — Polymarket · 2026-08-01
- CoreWeave 推出 Sandboxes:为 Agentic AI 提供执行层 — wandb · 2026-08-01