RTX 3090 本地跑 Strata:256k 上下文生成提速到 38-61 t/s
cezarducatti · reddit · 2026-10-03
非程序员作者分享在单卡 RTX 3090 + 128GB 内存上编译运行推理引擎 Strata 的完整实测,效果远超 llama.cpp master:
性能对比(Unsloth UD-Q3KXL 量化)
- Prompt 处理:约 1,650 t/s(llama.cpp 最高 700 t/s)
- 生成速度:38 t/s @182k 上下文,短上下文约 61 t/s(原 23 t/s)
- 上下文:256k fp16 KV(原 180k)
- Expert cache 命中率与投机解码(MTP)接受率均约 76%,OpenCode 中工具调用零报错
关键改动
- 量化侧加 --compat-bf16 打包
- 针对 sm86 重编译并开启 MMQ(Q4 类 prompt 速度翻倍)
- 关闭会崩溃的 fused kernel(STRATAPFFUSED=0)
- vision encoder 移到 GPU 并重编译 CUDA 版
- 逐模型校准 --pcie-frac、--pool-workers、--spec-min-p,用 --expert-profile-save 持久化 expert cache
作者还指出 Strata 默认推荐的量化虽更快但质量较差、易报错,实际更推荐 Unsloth 的量化版本。
「Infra」频道最新
- DwarfStar 4 发布:本地运行 DeepSeek V4.1、Qwen 与 GLM — yogthos · 2026-10-03
- 中端显卡用户集体观望:模型升级很快,但换卡的钱越来越不划算 — masiha97 · 2026-10-03
- Fireworks 发布 FireRouter with Opus:编码成本降 57% 仅损 1.5% 准确率 — Madisonkanna · 2026-10-03
- 曝 OpenAI 曾考虑 1 亿美元投资 Hugging Face,或涉芯片分发 — VraserX · 2026-10-03
- MegaCapybara:RTX 5090 专用推理引擎,速度达 Ninfer 两倍 — BringTea_666 · 2026-10-03
- 「反对降低电价因为利好数据中心」引发算力政策激辩 — 2C_ornot2C · 2026-10-03