Qwen3.8-Flash-Next 免费端点上线:H200 跑出 100 tok/s

victormustar · x · 2026-08-26

开发者 victormustar 部署了 Qwen3.8-Flash-Next 的免费公共端点,无需 Token 即可调用。该端点兼容 OpenAI 接口,支持视觉、工具调用及 26.2K 上下文。后端配置为 4× H200 (FP8),使用 SGLang cookbook,单流速度约 140 tok/s,16 并发下约 100 tok/s,TTFT 仅 0.8 秒。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →