GLM-5.3-Flash 支持百万上下文,实测速度超 160t/s

AutonomousHangOver · reddit · 2026-08-27

开发者 fork 了 GLM-5.3-Flash 的项目,使其适配 sm120 架构(4 x RTX6000 Pro)。

当前运行数据显示:支持 140 万上下文(约 5.45 个 262k 长度的会话),预填充速度达 3.7k t/s,Token 生成速度在 160-230 t/s 之间(已启用 MTP)。作者提供了相关的 vLLM Docker 镜像和 GitHub 仓库链接。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →