双 A100 显卡当前最佳的 LLM 推理方案是哪个?

Theio666 · reddit · 2026-08-30

用户询问在 2x A100 硬件上运行大模型的最佳实践,尤其是替代老旧的 GLM 4.5 Air(fp8) 方案。作者测试了 Qwen 2.5 122B,遇到了工具调用畸形、SGLang 兼容性差、vLLM 的 MTP 模块存在 bug 等问题。最终测试发现 Qwen 35B 在复杂法律任务上能力不足。用户倾向于使用 vLLM 作为推理框架,寻求在该尺寸和硬件限制下更稳定的模型推荐,且对量化(如 AWQ)持保留态度,因其在非英语任务上表现不佳。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →