NInfer 实现 RTX 3090 高效运行 Qwen3.8-27B
mrmontanasagrada · reddit · 2026-08-15
开发者在 RTX 3090 (24GB) 上移植并优化了 NInfer 运行时,成功运行 Qwen3.8-27B 模型。测试数据显示,通过启用 ReplaySSM 技术和 CUDA Graphs,单请求吞吐量达 71 tok/s,而在 8 并发请求下解码速度可达 165 tok/s,且显存占用控制在 24GB 以内。该项目展示了老款消费级显卡运行大模型的潜力,同时也提到了 Qwen3-35B-A3B 的初步测试结果。
「Infra」频道最新
- 研华推 AFE-A702 边缘设备,搭载 Thor 同步 8 路深度相机 — chrismatthieu · 2026-08-15
- ML 工程师 T.I.M 问题排查实战经验分享 — rosstaylor90 · 2026-08-15
- 前 Figma 设计高管:算力即主权 — soleio · 2026-08-15
- CEO亲自上手修复 sonic-moe 内核索引溢出Bug — rosstaylor90 · 2026-08-15
- 长文推理消耗惊人:2.2万 Token 仅生成 3千 字 — generativist · 2026-08-15
- NVIDIA 本地 AI 系统本周适配多款开源模型 — nvidia · 2026-08-15