Qwen3.8-Flash-Next 免费端点上线:H200 跑出 100 tok/s
victormustar · x · 2026-08-26
开发者 victormustar 部署了 Qwen3.8-Flash-Next 的免费公共端点,无需 Token 即可调用。该端点兼容 OpenAI 接口,支持视觉、工具调用及 26.2K 上下文。后端配置为 4× H200 (FP8),使用 SGLang cookbook,单流速度约 140 tok/s,16 并发下约 100 tok/s,TTFT 仅 0.8 秒。
「Infra」频道最新
- Local AI Registry 开源:索引硬件、模型与本地部署配方 — StefanoGogioso · 2026-08-26
- PyTorch 运行时 TRANSIT:大模型训练可省 50% 显卡 — PyTorch · 2026-08-26
- Ollama 宣布 GLM-5.3-Flash 模型即将上线云服务 — ollama · 2026-08-26
- 预测市场:2026年底AI泡沫破裂概率仅13% — Polymarket · 2026-08-26
- 开源 GPU 价格聚合器 Vram Watch 发布 — KyeGomezB · 2026-08-26
- OpenAI 拟建全球最大数据中心,需电超全州民用总和 — bennash · 2026-08-26