单卡跑出 2200 prefill,消费级本地推理速度一周涨近十倍
oran_ge · x · 2026-10-03
作者 orange 转引 @ivanalogcom 的实测:一周前双 5070ti 本地跑 Qwen Flash 只能到 200 prefill/10 decode,如今借助 Strata 架构与自制 PR,单卡即达 2200/67,读写速度均提升近十倍——这一水平此前只有 5090、DGX Spark、M3 Ultra 能达到,且多数模型 API 也达不到。
- 4090/5090 同样大幅受益,5090 流式处理速度已逼近 RTX 6000(显存仍是瓶颈)
- 消费级硬件因此涨价,连冷门的英特尔 32G B70 显卡都卖断货
- 性能提升源于 DeepSeek/Qwen Flash 的模型设计(把智力拆分为注意力、专家、查表)与 Strata 的流水线化架构,让不同层级的能力存放在不同速度的存储中按需抵达
作者判断:本地部署十倍提速对想拥有本地智力的人是重大利好,模型层设计可能正收敛到当前硬件下的最优解;而对靠出售平庸模型算力的 API 生意而言,这可能是催命符。
「Infra」频道最新
- GPU 是不是印钞机?SemiAnalysis 拆解推理经济与 Vera Rubin vs Blackwell — AccBalanced · 2026-10-03
- gufo 推出 Windows 免编译包,Strix Halo 用户开箱即用跑本地大模型 — hiImMate · 2026-10-03
- Musk 谈算力规模化:数量够大本身就是质变 — XFreeze · 2026-10-03
- RTX5080+64GB 内存能否跑出接近 Codex 的本地编码 Agent — evilgu · 2026-10-03
- 推理已超训练成最大市场,小型数据中心迎布局窗口 — AccBalanced · 2026-10-03
- 传 Terafab 目标年产 1 TW 算力,约为当前全球 AI 算力产出 50 倍 — XFreeze · 2026-10-03