单卡跑出 2200 prefill,消费级本地推理速度一周涨近十倍

oran_ge · x · 2026-10-03

作者 orange 转引 @ivanalogcom 的实测:一周前双 5070ti 本地跑 Qwen Flash 只能到 200 prefill/10 decode,如今借助 Strata 架构与自制 PR,单卡即达 2200/67,读写速度均提升近十倍——这一水平此前只有 5090、DGX Spark、M3 Ultra 能达到,且多数模型 API 也达不到。

作者判断:本地部署十倍提速对想拥有本地智力的人是重大利好,模型层设计可能正收敛到当前硬件下的最优解;而对靠出售平庸模型算力的 API 生意而言,这可能是催命符。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →