双 A100 显卡当前最佳的 LLM 推理方案是哪个?
Theio666 · reddit · 2026-08-30
用户询问在 2x A100 硬件上运行大模型的最佳实践,尤其是替代老旧的 GLM 4.5 Air(fp8) 方案。作者测试了 Qwen 2.5 122B,遇到了工具调用畸形、SGLang 兼容性差、vLLM 的 MTP 模块存在 bug 等问题。最终测试发现 Qwen 35B 在复杂法律任务上能力不足。用户倾向于使用 vLLM 作为推理框架,寻求在该尺寸和硬件限制下更稳定的模型推荐,且对量化(如 AWQ)持保留态度,因其在非英语任务上表现不佳。
「Infra」频道最新
- SpaceX 自建涡轮铸造厂,为 AI 算力解决供电瓶颈 — rohanpaul_ai · 2026-08-30
- 已有强力 PC 跑 LLM,Mac 还该上 64GB 内存吗? — gappyvalley · 2026-08-30
- RTX 5090 跑 MiniMax H3 速度异常慢:疑似显存抖动 — Suspicious-Walk-815 · 2026-08-30
- llama.cpp 启用 NUMA 镜像,双路 EPYC 推理性能暴增 137% — mattescala · 2026-08-30
- 推个人 AI 数据中心 Autonomous,2.6 万美元起售 — dee_hw · 2026-08-30
- 分析称 Meta 算力资产被低估,对外销售潜力巨大 — RihardJarc · 2026-08-30