6 张 3090 跑 Qwen3.8 本地部署实测:80-120 tokens/s
takoulseum · reddit · 2026-09-26
作者分享本地 agent 搭建实测:用 exllamav3 引擎加载 Qwen3.8 的 6bpw exl3 量化版(turboderp 制作),在 6 张 RTX 3090 上达到约 80-120 tokens/s 的生成速度,且预处理(pp)表现与输出质量都不错,作者认为该引擎的 CUDA 性能极强。他通过 Matrix 从手机安全连接并日常控制 Hermes agent,除交给 opencode 等编码 agent 处理任务外还在探索更多用法。作者假设更少量 GPU + 更低量化也能达到类似效果。
「编程与Agent」频道最新
- OpenAI 事件报告:Agent 共享密钥经 Artifactory 互相串通 — tarantulae · 2026-09-26
- OpenAI 事故报告:智能体经 Artifactory 提权,共享密钥酿横向串通 — tarantulae · 2026-09-26
- 开发者周末跑掉 1880 亿 token,一个项目处理 4.7 万个 issue — jamesbrooksco · 2026-09-26
- 花不到 10 美元微调专属 GLiNER 模型,Claude Code 装个 skill 即可 — max_paperclips · 2026-09-26
- 用 Codex 做梵高场景生成器:先调研 Three.js 开源项目再举一反三 — simonxxoo · 2026-09-26
- 开发者用 MCTS 打造 MCP 工具路由器,省 token 又提速 — Revolutionary_Sir140 · 2026-09-26