RTX 3090 跑 Qwen 3.8 27B 约 35 t/s
cviperr33 · reddit · 2026-08-15
用户报告在 RTX 3090 上使用 llama.cpp 运行 Qwen 3.8 27B(IQ4 NL 量化),速度约为 34-36 tokens/s。相比此前 3.6 版本的 50-60 t/s 有所下降,但尚未开启推测解码。尽管速度变慢,用户认为模型体验属于次世代级别。
「Infra」频道最新
- SpaceX与Nvidia合作设计轨道数据中心,首颗卫星明年发射 — JOBhakdi · 2026-08-15
- Qdrant+Minima 在单块 RTX PRO 6000 上实现 agentic RAG 效率提升 2.92 倍 — qdrant_engine · 2026-08-15
- 英伟达开源 NeMo Switchyard,支持智能体模型动态路由 — NVIDIAAI · 2026-08-15
- Vercel 被评为全球最快的 AI Gateway 基础设施 — cramforce · 2026-08-15
- Qwen3.8-2.4T-A95B部署指南:NVFP4需8×B300,TP必须整除64 — Necessary_Gazelle211 · 2026-08-15
- mcpp:自动从代码生成 MCP 服务器的 C++ 库 — karurochari · 2026-08-15