6 张 3090 跑 Qwen3.8 本地部署实测:80-120 tokens/s

takoulseum · reddit · 2026-09-26

作者分享本地 agent 搭建实测:用 exllamav3 引擎加载 Qwen3.8 的 6bpw exl3 量化版(turboderp 制作),在 6 张 RTX 3090 上达到约 80-120 tokens/s 的生成速度,且预处理(pp)表现与输出质量都不错,作者认为该引擎的 CUDA 性能极强。他通过 Matrix 从手机安全连接并日常控制 Hermes agent,除交给 opencode 等编码 agent 处理任务外还在探索更多用法。作者假设更少量 GPU + 更低量化也能达到类似效果。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →