定制 RTX 5090 推理栈宣称 Qwen 3.6 35B 跑到 700 tokens/s
BringTea_666 · reddit · 2026-07-28
定制 RTX 5090 推理引擎,号称 Qwen 3.6 35B 跑到 700 tokens/s
一位 Reddit 用户在 Windows 上跑通了 Ninfer,并称它在 RTX 5090 上运行 Qwen 3.6 35B 时,吞吐能达到大约 550–720 tokens/s,具体数字会随任务变化。
帖子里的要点
- 过去要靠 batching 或多 agent 并行,才能接近这种吞吐。
- 现在用 单实例 就能达到类似速度。
- 作者还说它支持 完整 250k context。
- 这个项目被描述为一个 专门为 RTX 5090 定制 的推理构建,目前只支持 Qwen 3.6 27B 和 35B。
- 贴出的 GitHub 仓库是 Linux 优先,但作者说可以通过一些方式在 Windows 上跑起来。
这条帖子的核心卖点是:消费级硬件上,已经能做出接近 Cerebras 体感的本地推理速度。
「编程与Agent」频道最新
- 东京 Codex Meetup 将讨论 CLI 贡献与智能体工作流 — paw_lean · 2026-07-28
- 开源基准工具可安全统计 coding agent token 消耗 — bestofdesp · 2026-07-28
- Matt Pocock 说 AGENTS.md 修剪课成了整门课最长一节 — mattpocockuk · 2026-07-28
- 更强模型也可能拖垮产品,先做生产任务测试 — max_gladysh · 2026-07-28
- Claude Code 主打终端内代理取代复制粘贴式开发 — Aiden_Tech_Ai · 2026-07-28
- 把 Claude Code 变成设计流水线,而不是一次性提示词 — PrajwalTomar_ · 2026-07-28