Qwen 27B 在双 5090 上跑出 1253 tok/s,成本仅为 API 价 1/8
me_broke · reddit · 2026-09-19
一个推理项目团队(astorias.ai)分享优化成果:Qwen 3.8 27B 在 2 张 RTX 5090 上达到 1253 tok/s,常规请求平均 TTFT 低于 2 秒。技术栈为 sglang + Dflash2,配置通过 agentic loop 自动调优,后续还计划做内核优化并公开复现配方。经济账:vast.ai 上最低配 2x5090 节点约 $0.88/小时(月约 $650),可承载相当于 API 价格 $8-10k 的推理量,比 OpenRouter 最便宜的供应商省 8-10 倍。
「Infra」频道最新
- AWS 把 DRAM 当Agent稀缺资源:AgentCore 运行时按需驻留、超售降本 — bookwormengr · 2026-09-19
- Jeff Dean:芯片设计循环提速到可供 RL 搜索,2 年周期缩至 3 个月 — haider1 · 2026-09-19
- 曝微软拟 2032 年前将数据中心容量扩至 38GW,增至三倍多 — Beth_Kindig · 2026-09-19
- OpenAI 用自家 LLM 设计 Jalapeño 芯片,IEEE Spectrum 揭秘流程 — maxall4 · 2026-09-19
- 全球约20%芯片设计工程师在印度,美系大厂大量设计团队落地当地 — bookwormengr · 2026-09-19
- HBM 市场 2027 年或达千亿美元,美光锁 5 年长约改写内存周期 — Beth_Kindig · 2026-09-19