OpenAI 仅 30 TPS?开发者称本地 Qwen 速度已可追平官方 API
drdanielbender · x · 2026-10-10
- 开发者 Daniel Bender 惊讶于 OpenAI 的服务速度仅为每秒 30 token,并引用 thsottiaux 的说法:优化后可达 50 TPS 且配有最优化 tokenizer,所用模型在完成任务所需 token 数上也很高效。
- 他表示自己本地跑的 Qwen3.8-flash-next 实验已达 50 TPS,速度追平 OpenAI 官方服务,感叹开源与本地部署的推理速度已今非昔比。
「Infra」频道最新
- 决策模型 Drex 1.5 上线 OpenRouter,自称当前最快分类决策模型 — Div_pradeep · 2026-10-10
- VC 提醒:算力租约买多会拖垮公司,买少会错失增长 — darian314 · 2026-10-10
- 麦当劳豪掷85亿美元改造门店,AI 点餐靠边缘计算落地 — sanjaykalra · 2026-10-10
- Epoch AI 实测:GPT-6.1 Sol 缓存输入价格砍半,长提示更快 — Jsevillamol · 2026-10-10
- 开源 LLM 网关 RouteHub 发布:导入速度比 LiteLLM 快 190 倍 — KyeGomezB · 2026-10-10
- 开发者吐槽在 Azure 获取模型 EU 配额之难 — kevinkern · 2026-10-10