单张 5090 跑 512k 上下文:Infernix 比 Strata 快 23%,137 tok/s

zipzak · reddit · 2026-10-10

Reddit 用户在 Windows 11 + RTX 5090(32GB)+ 189.6GB 内存平台上,对同一模型(Qwen3.8-Flash-Next Uncensored)A/B 测试了两款本地推理引擎 Strata 与 Infernix,同日交错跑分、每格 3 次取中位数,推理约定一致(int8 KV、MTP spec-4、YaRN 2 到 512k)。

结果(解码 tok/s / 冷预填 tok/s):262k 上下文下 Strata Q4KS 为 120.6/1,550,Infernix NVFP4 为 149.0/3,548;512k 下分别为 126.3/3,045 与 137.0/3,497。

要点:

结论:作者把 Infernix NVFP4(76.3GB 量化件 + 52GB 共享 n-gram 卷)作为日常主力——单卡 5090 上 512k 上下文、约 150 tok/s 还带视觉;Strata 留作第二引擎。作者还称它在编码和 agent 任务中纠正过 DeepSeek 4.1 和 GLM 5.3 Flash 付费 API 写出的错误。

注意事项:解码在约 39k 有效上下文处测得;±10-15 tok/s 的跑动噪声,小于 10% 的差距应视为噪声;YaRN 超 262k 属实验性。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →