RTX Pro 6000 上 Ninfer 跑 Qwen3.6 35B 达 600 tok/s
CharlesStross · reddit · 2026-09-18
Reddit 用户报告在 RTX Pro 6000 上用 Ninfer 对 qwen3.6 35BA3B 实现单请求 600 tok/s 的生成速度。作者将其当作「苦力型」模型用于读取查找和可容忍暴力试错的编码任务:即便 token 用量多 20 倍,仍比许多本地模型快,速度接近 Cerebras 服务水平。
「Infra」频道最新
- 神秘买家豪掷 1 亿美元权利金,狂买 10 月 2 日到期 AI 股看涨期权 — toptickcrypto · 2026-09-18
- 首届 PyTorch Day Japan 定档 12 月 10 日东京举办 — PyTorch · 2026-09-18
- 自建 Blackwell Colab 管线:2 小时 MiniMax H3 视频只要 $6.96 — Interesting-Town-433 · 2026-09-18
- LaurieWired 在 CppCon 主题演讲谈内存层级新趋势 — lauriewired · 2026-09-18
- NVIDIA 直播:用 CUDA 全栈支撑金融、医疗、制造业的专用 AI 负载 — NVIDIA Developer · 2026-09-18
- Cadence:印度EDA市场2031年将达78亿美元 — bookwormengr · 2026-09-18