定制 RTX 5090 推理栈宣称 Qwen 3.6 35B 跑到 700 tokens/s
BringTea_666 · reddit · 2026-07-28
定制 RTX 5090 推理引擎,号称 Qwen 3.6 35B 跑到 700 tokens/s
一位 Reddit 用户在 Windows 上跑通了 Ninfer,并称它在 RTX 5090 上运行 Qwen 3.6 35B 时,吞吐能达到大约 550–720 tokens/s,具体数字会随任务变化。
帖子里的要点
- 过去要靠 batching 或多 agent 并行,才能接近这种吞吐。
- 现在用 单实例 就能达到类似速度。
- 作者还说它支持 完整 250k context。
- 这个项目被描述为一个 专门为 RTX 5090 定制 的推理构建,目前只支持 Qwen 3.6 27B 和 35B。
- 贴出的 GitHub 仓库是 Linux 优先,但作者说可以通过一些方式在 Windows 上跑起来。
这条帖子的核心卖点是:消费级硬件上,已经能做出接近 Cerebras 体感的本地推理速度。
「编程与Agent」频道最新
- Alchemy 新增 Kubernetes 文档中心,从 kind 集群到 EKS 部署全流程 — samgoodwin89 · 2026-09-23
- Rat Stack:把应用和云写成一个类型化程序,让 AI agent 可靠地搭建部署 — samgoodwin89 · 2026-09-23
- 「还记得 Tab 补全吗」:编码方式两年间的狂飙变迁 — yoobinray · 2026-09-23
- 调查:1/4 的 AI Agent 处于无人监控状态 — rseroter · 2026-09-23
- Massive 联手 Coinbase,AI Agent 可付费获取实时市场数据 — kleffew94 · 2026-09-23
- optimAIzr:本地 CLI 找出 AI 用量浪费,支持 Claude Code 与 Codex 省钱 — stichstichstich · 2026-09-23