Qwen 27B 在双 5090 上跑出 1253 tok/s,成本仅为 API 价 1/8

me_broke · reddit · 2026-09-19

一个推理项目团队(astorias.ai)分享优化成果:Qwen 3.8 27B 在 2 张 RTX 5090 上达到 1253 tok/s,常规请求平均 TTFT 低于 2 秒。技术栈为 sglang + Dflash2,配置通过 agentic loop 自动调优,后续还计划做内核优化并公开复现配方。经济账:vast.ai 上最低配 2x5090 节点约 $0.88/小时(月约 $650),可承载相当于 API 价格 $8-10k 的推理量,比 OpenRouter 最便宜的供应商省 8-10 倍。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →