4090 本地跑 Qwen 27B:近100 token/s
cocktailpeanut · x · 2026-08-16
用户 zast57 在 RTX 4090 上通过 Ollama + OpenWebUI(经 Pinokio 一键部署)本地运行 Qwen 3 系列 27B 模型(原帖写作 Qwen 3.28:27b),实测生成速度:
- 校对文本任务:90.26 response token/s
- 生成 Connect 4 游戏代码:96.77 response token/s
他对这个速度表示惊喜。Pinokio 作者 cocktailpeanut 转发了该实测。
「Infra」频道最新
- 实测:Qwen 3.8 27B 在 MTP 开启时 Q8 竟比 Q6 更快 — jcmyang · 2026-08-16
- 新引擎NInfer在RTX 5090上跑Qwen3.8-27B达880 tok/s — Ond7 · 2026-08-16
- 传 Nvidia 拟投 30 亿美元,助 OpenAI 锁定俄州数据中心 — rohanpaul_ai · 2026-08-16
- Seeed 推出 reComputer RK3576 边缘 AI 模块 — ___Mufasaa · 2026-08-16
- Agent 容量规划指南:避免生产环境算力惊魂 — blaizedsouza · 2026-08-16
- GPU 架构与显存带宽如何决定 LLM 推理速度 — blaizedsouza · 2026-08-16