实测:RunPod 自托管 Qwen 27B 生成仅 17 tok/s,长输出成本反输 OpenAI

yeah280 · reddit · 2026-09-11

楼主实测用 RunPod Serverless(48GB VRAM,$1.22/小时)自托管 Qwen3.8-27B GGUF Q80(llama.cpp),替代 OpenAI API 处理约 47k token 的视频转录分析任务(输出结构化 JSON)。

关键数据:

结论倾向:对长上下文大输出任务,OpenAI 优化过的推理在经济性上极难击败,关键是算『单次任务成本』而非 GPU 小时成本。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →