4090 48G 实测 Strata:会话驻留快 35 倍,n-gram 表进内存仅提升约 1%

Shot-Ad-4147 · reddit · 2026-10-04

作者在 i9-13900K + RTX 4090 48GB(刷 48G 显存)+ 128GB DDR5 机器上,用 91,836 token 的真实长文本实测 Strata 0.1.38 的推理调优。

n-gram 表存放位置的 4 组对照

方法论教训:作者此前报告的 +4.7% 是错误基线——相同配置跨会话的波动高达 11.5%(149.1 → 166.3 tok/s),A/B 测试必须在同一会话内背靠背跑,否则发布的是噪声。

最大的收益来自会话驻留(35 倍):配置 --conversation-cache-mib 8192 + 4 个 slot 后,返回一个 91,836 token 的旧对话从 19.5s 降到 537ms,仅占 3.1GB 内存。

其他调优点:--prefill auto:32768 在 78.7K prompt 上带来 +9.7% prefill / +13.6% decode;--calibrate 又通过把 CPU workers 从 23 调到 12 找到 +3.2%。基线吞吐:decode 128-151 tok/s,prefill 4,249-5,154 tok/s。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →