双卡跑 262K 上下文:三个补丁把 Strata 推理提速至 130 tok/s
Fz1zz · reddit · 2026-10-03
Reddit 用户分享在 RTX 5090(32GB)+ RTX 4070 Ti SUPER(16GB,接芯片组 PCIe x1 仅 0.8GB/s)+ 31GB 内存的普通主机上,用 Strata 引擎跑 Qwen3.8-Flash-Next(ISTA GSQ-RCO IQ3XXS 量化,专家文件超内存)达成 262K 全上下文推理的完整过程。
- 基线:官方 v0.1.33 层拆分 36,80K prompt 仅 890 tok/s,双会话切换要 20-48 秒
- 三个自写补丁:
- prompt 全部在大卡上 prefill(移植 Strata PR #269),之后只把用到的 cell 状态复制给小卡,会话「停车」切换降至 0.6-1.2 秒
- 内存压力下 MADVWILLNEED 预读失效导致海量 major page fault,改用逐片 pread 后,每次基准的 major fault 从 2400 万降到 1.4 万
- --prefill auto:32768 加大 prefill 块,块数减少 4 倍显著省去专家重流
最终配置(int8 KV、每层驻留 32K cell、MTP spec 4、视觉开启)成绩:80K 新 prompt 1796 tok/s(45 秒)、解码中位数 128-134 tok/s、80K 会话续轮 6 秒,40K 针测试与双会话停车测试全对。补丁、安装脚本与基准工具已开源:github.com/ExTV/strata-5090-4070。
「Infra」频道最新
- Suhail 宣布 Vera Rubin 时代开启,NVIDIA 新一代 GPU 上线 — rickasaurus · 2026-10-03
- GPU 抵押贷款兴起,算力定价透明度成借贷核心争议 — AnneliesGamble · 2026-10-03
- 谷歌被指在芬兰砍伐3亿平方米森林建AI数据中心 — Polymarket · 2026-10-03
- SkyRL v0.4 发布:16 张 B300 即可对 1T 参数 Kimi K2.7 做 RL 后训练 — casper_hansen_ · 2026-10-03
- 国际清算银行报告:AI 公司超半数投资来自同行,循环融资藏系统性风险 — rohanpaul_ai · 2026-10-03
- 分析师预判:内存价格明年或涨 10 到 20 倍,2028 再翻番 — Kyrannio · 2026-10-03