三张 5060 Ti 本地跑 27B 模型:一套 MoA 工作流的真实体验账

Then_Blueberry7290 · reddit · 2026-09-05

一位用户分享其公司本地 AI 部署的完整硬件与模型配置:Dell 5820 工作站(Xeon w2245)加两张 RTX 5060 Ti 16GB,跑 NVFP4 量化的 Qwen3.8-27B,可支持 210k 上下文、Q8 KV cache 和视觉模型,生成速度约 38-44 tokens/s。

加装第三张 5060 Ti 后遇到问题:需外接 riser、散热恶化导致数小时后不稳定,且三卡 TP 反而拖慢推理。尝试转向双机方案:在一台无 GPU 的游戏 PC 上单独挂第三张卡,16GB VRAM 下测试 Ornith 1.5 35B(17-20 t/s)和 Gemma 4 26B NVFP(30-40 t/s)。

实际用途包括:WordPress 网站运维 agent、办公文档处理、为 Z-Image Turbo / LTX 2.5 等图像视频模型生成提示词并驱动 ComfyUI 渲染。当前 MoA 组合为 Gemma 4 26B 做参考 + Qwen 3.8 27B 做聚合,并指出 Gemma 系列在工具调用上偏懒。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →