单张 5090 跑 512k 上下文:Infernix 比 Strata 快 23%,137 tok/s
zipzak · reddit · 2026-10-10
Reddit 用户在 Windows 11 + RTX 5090(32GB)+ 189.6GB 内存平台上,对同一模型(Qwen3.8-Flash-Next Uncensored)A/B 测试了两款本地推理引擎 Strata 与 Infernix,同日交错跑分、每格 3 次取中位数,推理约定一致(int8 KV、MTP spec-4、YaRN 2 到 512k)。
结果(解码 tok/s / 冷预填 tok/s):262k 上下文下 Strata Q4KS 为 120.6/1,550,Infernix NVFP4 为 149.0/3,548;512k 下分别为 126.3/3,045 与 137.0/3,497。
要点:
- Infernix 解码快 23%(262k)/9%(512k),512k 上下文的代价极小(≤8%),瓶颈在专家权重而非 KV
- 前缀缓存让重复长提示词几乎免费(39k 提示词热预填仅约 0.09 秒)
- 质量上两者统计打平:teacher-forced PPL 4.772 vs 4.844,ΔNLL −0.015±0.010
- 双引擎视觉模式均可用;Infernix 冷启动约 28 秒,Strata 约 1 分钟
结论:作者把 Infernix NVFP4(76.3GB 量化件 + 52GB 共享 n-gram 卷)作为日常主力——单卡 5090 上 512k 上下文、约 150 tok/s 还带视觉;Strata 留作第二引擎。作者还称它在编码和 agent 任务中纠正过 DeepSeek 4.1 和 GLM 5.3 Flash 付费 API 写出的错误。
注意事项:解码在约 39k 有效上下文处测得;±10-15 tok/s 的跑动噪声,小于 10% 的差距应视为噪声;YaRN 超 262k 属实验性。
「Infra」频道最新
- 开发者实践:常驻 VM 上「dev in prod」跑周报小软件 — davidcrawshaw · 2026-10-11
- Zeeg 断言:给 Agent 用持久 VM 已经过时,临时沙箱才是当下正解 — zeeg · 2026-10-11
- OpenRouter 年化推理流水约 15 亿美元,Anthropic 占 36% — deedydas · 2026-10-11
- 传 AMD 上调 GDDR6 供货价,5090 停售涨价压力蔓延 — chemist_slime · 2026-10-11
- M5 Ultra Mac Studio 64 核 vs 80 核:多花 1200 美元等 10 周值吗 — Porespellar · 2026-10-11
- 弗州动物收容所控诉:邻近数据中心噪音吓坏救援犬 — Polymarket · 2026-10-11