4090 48G 实测 Strata:会话驻留快 35 倍,n-gram 表进内存仅提升约 1%
Shot-Ad-4147 · reddit · 2026-10-04
作者在 i9-13900K + RTX 4090 48GB(刷 48G 显存)+ 128GB DDR5 机器上,用 91,836 token 的真实长文本实测 Strata 0.1.38 的推理调优。
n-gram 表存放位置的 4 组对照
- 全表驻留内存(+28.4 GiB RAM):warm prefill 仅 +0.65%、decode 仅 +1.2%——SSD 上的 n-gram 表在这台机器上根本不是瓶颈,不值得堆内存。
- --ple-io mmap 反而更差:首个长 prompt 冷启动 72.8s vs 19.5s(慢 3.7 倍),且会静默禁用 row-cache。
- 默认约 90MB 的 row-cache 已吸收 92% 的可复用磁盘流量(3,114MB → 242MB)。
方法论教训:作者此前报告的 +4.7% 是错误基线——相同配置跨会话的波动高达 11.5%(149.1 → 166.3 tok/s),A/B 测试必须在同一会话内背靠背跑,否则发布的是噪声。
最大的收益来自会话驻留(35 倍):配置 --conversation-cache-mib 8192 + 4 个 slot 后,返回一个 91,836 token 的旧对话从 19.5s 降到 537ms,仅占 3.1GB 内存。
其他调优点:--prefill auto:32768 在 78.7K prompt 上带来 +9.7% prefill / +13.6% decode;--calibrate 又通过把 CPU workers 从 23 调到 12 找到 +3.2%。基线吞吐:decode 128-151 tok/s,prefill 4,249-5,154 tok/s。
「Infra」频道最新
- Cloudflare 开源决策模型 Clef:RTX 5090 上单次决策仅 53ms — michellechen · 2026-10-04
- 腾讯拟租 10 万颗芯片,英格兰银行警示 agent 风险 — MirelaXhota · 2026-10-04
- 单张 R9700 跑 Qwen 27B:3-bit 量化换来 569K token 缓存与 12 倍提速 — evp-cloud · 2026-10-04
- 开源项目 Strata 让 RTX 4090 跑 125B 模型,速度达 100 tokens/s — snehesht · 2026-10-04
- 让 agent 内部回环执行 cron 任务,Cloudflare Workers p90 查询降 75% — DanielLockyer · 2026-10-04
- Aletheia:AMD 2027 服务器 CPU 目标受供给限制,2028 年或增 70% — zephyr_z9 · 2026-10-04