GLM-5-32B实现超200 tok/s极速推理体验

Xianbao_QIAN · x · 2026-07-13

作者分享了使用开源模型带来的极速推理体验,强调开源的胜利不仅在于权重控制,更在于全球专家共同构建的强大基础设施。 在实测中,GLM-5-32B FP8 原始模型在多子智能体并行时,单流解码速度超过 200 tok/s。这种速度让智能体运行快于人类思考,并能主动在用户提出需求前给出结果。该测试基于 @Zai_org 团队开发的智能体框架,推理后端采用 vLLM 和 LiteLLM,仅使用默认参数并启用内置 MTP,未做复杂特殊优化。

所属事件:开源推理栈实现超200 tok/s极速体验(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →