定制 RTX 5090 推理栈宣称 Qwen 3.6 35B 跑到 700 tokens/s

BringTea_666 · reddit · 2026-07-28

定制 RTX 5090 推理引擎,号称 Qwen 3.6 35B 跑到 700 tokens/s

一位 Reddit 用户在 Windows 上跑通了 Ninfer,并称它在 RTX 5090 上运行 Qwen 3.6 35B 时,吞吐能达到大约 550–720 tokens/s,具体数字会随任务变化。

帖子里的要点

这条帖子的核心卖点是:消费级硬件上,已经能做出接近 Cerebras 体感的本地推理速度。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →