跑一次校准解码快 3 倍:16GB 显卡跑 256K 上下文的调优实录
MoonsvnLyn · reddit · 2026-10-04
作者在 5070 Ti(16GB)+ 14700KF + 96GB 内存的机器上,用 Strata 跑 Qwen3.8-Flash-Next IQ3S 量化、262K 上下文(KV cache 存内存、按 32K 窗口流入显存),解码速度从 17.2 tok/s 提升到冷启动 43、前缀缓存后 53.5 tok/s,并给出复现步骤:
- --pool-workers 13 替代默认 19(单项 +47%):CPU 负责补算未命中专家,每个 verify 窗口等最慢线程,E-core 拖慢全局;默认值是在无 E-core 的 6 核 Ryzen 上调的,Intel 12-14 代混合架构务必跑 calibrate。
- --spec 6 + --spec-min-p 0.70:更深投机解码窗口,但仅在高置信时扩展,接受率从约 53% 升到 70-79%,深窗口变成免费速度。
- --pcie-frag 0:PCIe 5 x16 + 快 CPU 下,原地补算专家优于走总线拷贝,校准曲线从 42.1 tok/s(0.0)降到 20.7(0.75)。
- 另外保留学习型专家配置文件(启动更暖,稳态差别不大)。
注意事项:重跑 setup 会重写配置并丢失 profile 参数;完整数据与复现步骤见作者发布在 Strata 仓库 docs 的调优文档,并已向上游提交 issue。
「编程与Agent」频道最新
- vibe coding 需求说不清,Opus 5.5 也会写出漏洞 — gefei55 · 2026-10-04
- Agent 太多管不过来:David Khourshid 自嘲已看不懂自家在跑啥 — DavidKPiano · 2026-10-04
- Harness 工程被低估:好模型不等于好 agent — techNmak · 2026-10-04
- 模型不等于 Agent:一篇从第一性原理讲透 Agent Harness 的技术手册 — techNmak · 2026-10-04
- 三台本地机各构建 Miro 克隆五次,tokens/s 指标毫无意义 — julianharris · 2026-10-04
- 开发者逆向 Codex 桌面应用:让 Opus 挂上 Codex 全套工具,同线程切换 Claude 与 GPT — almmaasoglu · 2026-10-04