实测:RunPod 自托管 Qwen 27B 生成仅 17 tok/s,长输出成本反输 OpenAI
yeah280 · reddit · 2026-09-11
楼主实测用 RunPod Serverless(48GB VRAM,$1.22/小时)自托管 Qwen3.8-27B GGUF Q80(llama.cpp),替代 OpenAI API 处理约 47k token 的视频转录分析任务(输出结构化 JSON)。
关键数据:
- Prompt 处理很快:47,064 token 约 43.87 秒,1073 tok/s;但生成仅 17.2 tok/s,单次近 9k 输出 token 需约 8.7 分钟,每条视频成本 $0.20-0.30。
- 现行 OpenAI 方案(GPT-5.6 Sol,flex 档):160 万 token 仅约 $5,速度可靠。
- llama.cpp 加载时出现未使用的 NextN/MTP 张量警告,疑似投机解码组件未启用。
- 楼主列举可能的优化:降量化到 Q4KM/Q5、上下文 256k 降到 64k、启用 MTP/投机解码、换 vLLM、换 5090/L40S/H100、禁用思考模式等。
结论倾向:对长上下文大输出任务,OpenAI 优化过的推理在经济性上极难击败,关键是算『单次任务成本』而非 GPU 小时成本。
「Infra」频道最新
- 176KB C 程序在单 CPU + 8GB 内存上跑 2.78 万亿参数模型 — techNmak · 2026-09-11
- Blackstone 重仓 AI 算力,联手 Google、Nvidia、Anthropic 下注 — abhiadesai · 2026-09-11
- 前沿模型已学会投机解码与核优化,InferenceBench 上自出招 — maksym_andr · 2026-09-11
- 预算友好多 GPU 本地 LLM 搭建实录:写给新人的入门指南 — lblblllb · 2026-09-11
- 腾讯参投的燧原科技上海上市首日暴涨 179%,募资 9.1 亿美元 — pstAsiatech · 2026-09-11
- Qwen3.8 Flash Next 本地跑出 49 tokens/s,双 3090 配置全公开 — whiteh4cker · 2026-09-11