GLM-5.3-Flash 支持百万上下文,实测速度超 160t/s
AutonomousHangOver · reddit · 2026-08-27
开发者 fork 了 GLM-5.3-Flash 的项目,使其适配 sm120 架构(4 x RTX6000 Pro)。
当前运行数据显示:支持 140 万上下文(约 5.45 个 262k 长度的会话),预填充速度达 3.7k t/s,Token 生成速度在 160-230 t/s 之间(已启用 MTP)。作者提供了相关的 vLLM Docker 镜像和 GitHub 仓库链接。
「Infra」频道最新
- 非对称量化实战:医学模型体积缩至 1/16 仅损 0.01 精度 — lateinteraction · 2026-08-27
- 算力租赁经济账:M5 Ultra Studio 月租 $257 可比 API 订阅 — SumitGup · 2026-08-27
- 一台 DGX Spark 能同时服务多少人?社区征集真实数据 — edge_compute_user · 2026-08-27
- Unsloth 被请求用 UD 3.0 重量化 Qwen 旧版模型 — Fancy-Snow7 · 2026-08-27
- QNX 携手 Hailo 做边缘 Physical AI:性能一致性提升 14 倍 — pdamodaran · 2026-08-27
- 美企算力优势达 15-20 倍,但在特定威胁下或无效 — ohlennart · 2026-08-27