单卡 RTX PRO 4500 32GB 跑 188k 上下文,推理速度达 60-67 tok/s
sdfprwggv · reddit · 2026-10-06
Reddit 用户分享在单张 RTX PRO 4500(32GB 显存)+ 64GB DDR5 内存上,用 Strata NVFP4 fork 运行 Qwen3.8-Flash-Next NVFP4 量化模型的本地推理方案。
技术栈要点
- NVFP4 路由专家(约 63.3 GiB)+ 独立 FP8 PLE + INT8 KV cache + MTP 投机解码,Blackwell 上 W4A8 prefill
- 通过 Strata 的 OpenAI 兼容服务器对外服务
实测成绩
- 约 50k 上下文:最高约 80 tok/s
- 约 188k 热上下文:约 60–67 tok/s
- 冷启动 189k 完整 prompt:prefill 约 1,680 tok/s,decode 约 53 tok/s
帖子附完整启动参数与模型/代码链接,展示了在消费级硬件上跑超大上下文 MoE 模型的完整可行方案。
「Infra」频道最新
- M5 Ultra 对决双 DGX Spark:本地跑大模型硬件实测 — kaggie · 2026-10-06
- Orbital AI 或提前至 2028:每公斤 700 美元成本成关键门槛 — JOBhakdi · 2026-10-06
- 2 美元 ESP32-C3 跑起 Pi-hole 级广告拦截,53.7 万域名塞进闪存 — M-Abozaid · 2026-10-06
- Model census 每日实测各家 API:哪些模型还在服务、何时下线一目了然 — repligate · 2026-10-06
- Cloudflare 新功能:Workers 直连 Artifacts 仓库,构建链路摆脱 GitHub 依赖 — threepointone · 2026-10-06
- Vultr 斥资 12 亿美元订购 AMD Helios AI 机架,客户提前数年锁算力 — shashib · 2026-10-06