自研推理引擎让 12GB 显存跑 Qwen3.8-Flash-Next 达 65 tok/s
KnownAd4832 · reddit · 2026-09-25
作者此前用 IQ3XXS 量化在 12GB RTX 5070 上跑 Qwen3.8-Flash-Next 只有 15 tok/s 输出。之后他专门针对这个模型和这台电脑自研了一个推理引擎(Strata,已开源,一键安装,目前仅优化 CUDA),同一量化下输出速度提升到约 65 tok/s,prompt 处理约 430 tok/s,2-bit 量化用 RCO-GSQ 方案还能更快。
硬件配置:64GB DDR5-5600 + RTX 5070 SFF + Ryzen 5 7600,Windows。128K 上下文下的实测:
- 输出速度:Q20 65.1 / IQ2XS 52.0 / IQ3XXS 44.8 tok/s
- Prompt 处理:Q20 543 / IQ2XS 472 / IQ3XXS 414 tok/s
- 内存需求(RAM+VRAM):Q20 最少 37.6GB,IQ2XS 39.2GB,IQ3XXS 47GB(视觉编码器另需 0.91GB)
模型来自 ISTA-DASLab 发布的 GGUF 量化版本。
「Infra」频道最新
- 曝 AI 芯片创企 DensityAI 拟融资数亿美元,估值 100 亿美元 — steph_palazzolo · 2026-09-25
- 曝 xAI 三个月内点亮 66 万张 GB300,年底 GPU 总量达 144 万 — ns123abc · 2026-09-25
- Epoch AI 图表:同等智能水平 AI 价格持续跳水,降幅超其他技术 — jeff_weinstein · 2026-09-25
- 多智能体通信催生新基建:Agent 间的「全局总线」会是下一个原语 — madhavsinghal_ · 2026-09-25
- 投资人预言:3-5 年内芯片到 PCB 设计将融合成一条连续流 — ai · 2026-09-25
- 高通 2nm 骁龙8至尊版发布:CPU 首破 5GHz,全线为智能体重写架构 — 量子位 · 2026-09-25