三张 5060 Ti 本地跑 27B 模型:一套 MoA 工作流的真实体验账
Then_Blueberry7290 · reddit · 2026-09-05
一位用户分享其公司本地 AI 部署的完整硬件与模型配置:Dell 5820 工作站(Xeon w2245)加两张 RTX 5060 Ti 16GB,跑 NVFP4 量化的 Qwen3.8-27B,可支持 210k 上下文、Q8 KV cache 和视觉模型,生成速度约 38-44 tokens/s。
加装第三张 5060 Ti 后遇到问题:需外接 riser、散热恶化导致数小时后不稳定,且三卡 TP 反而拖慢推理。尝试转向双机方案:在一台无 GPU 的游戏 PC 上单独挂第三张卡,16GB VRAM 下测试 Ornith 1.5 35B(17-20 t/s)和 Gemma 4 26B NVFP(30-40 t/s)。
实际用途包括:WordPress 网站运维 agent、办公文档处理、为 Z-Image Turbo / LTX 2.5 等图像视频模型生成提示词并驱动 ComfyUI 渲染。当前 MoA 组合为 Gemma 4 26B 做参考 + Qwen 3.8 27B 做聚合,并指出 Gemma 系列在工具调用上偏懒。
「编程与Agent」频道最新
- 数据科学家自述:90%同行不敢碰时间序列预测,3分钟讲清5个核心概念 — mdancho84 · 2026-09-05
- Hugging Face 自曝内部 Moon Bot:Slack 原生编码 Agent 全解析 — victormustar · 2026-09-05
- 开发者把澳洲工作日 MCP 扩成 4 工具日期引擎并上架官方 Registry — Impossible_Bit_2676 · 2026-09-05
- 知名开源作者判断:computer use 正处在 2025 年 11 月编码 Agent 的时刻 — austinvhuang · 2026-09-05
- 开发者优化 GLM 5.2 在 B300 上的推理速度,并替换 Claude Code 中的 Anthropic 模型 — abhijithneil · 2026-09-05
- LLM 推理从 MVP 到生产:什么逼你换掉整套技术栈 — Ok_Philosophy_4031 · 2026-09-05