单 3090 显卡用户求 Qwen3 模型最佳本地部署配置
sagiroth · reddit · 2026-08-16
Reddit 用户询问在单张 RTX 3090 上运行 Qwen3.8 模型的最佳配置方案。讨论涉及不同的推理引擎(如 vLLM、llama.cpp)及优化设置,以在有限显存下获得最佳性能。
「Infra」频道最新
- MLX-VLM登顶Apple Silicon推理速度榜,36.4 tok/s刷新纪录 — andrejusb · 2026-08-16
- 为了省钱,我用 If/Else 代替了 Agent — newbietofx · 2026-08-16
- AI 游戏算力推演:地球或将变成计算机 — davidmanheim · 2026-08-16
- 量化 K/V Cache 是否影响模型体验? — False-Advantage-4984 · 2026-08-16
- MCP转向无状态后,我们还需要Gateway吗 — wallphaser231 · 2026-08-16
- Cloudflare Artifacts 支持欧盟和美国数据本地化 — dinasaur_404 · 2026-08-16