RTX Pro 6000 上 Ninfer 跑 Qwen3.6 35B 达 600 tok/s

CharlesStross · reddit · 2026-09-18

Reddit 用户报告在 RTX Pro 6000 上用 Ninfer 对 qwen3.6 35BA3B 实现单请求 600 tok/s 的生成速度。作者将其当作「苦力型」模型用于读取查找和可容忍暴力试错的编码任务:即便 token 用量多 20 倍,仍比许多本地模型快,速度接近 Cerebras 服务水平。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →