Prime Intellect 推理服务上线,号称 GLM 5.3 最高吞吐
willcb · x · 2026-09-25
Vincent Weisser 转发称 Prime Intellect 提供目前最高吞吐的 GLM 5.3 推理服务。其 Inference API 兼容 OpenAI 接口,主打大规模评测场景:支持 Prime CLI 一行命令跑环境评测(如 gsm8k),也可直接用 OpenAI SDK 接入,团队账号可用 X-Prime-Team-ID 头共享团队额度。
这是智谱最新模型 GLM 5.3 在第三方推理平台落地的一个信号,对跑评测和批量推理的开发者是新的供应商选项。
「Infra」频道最新
- Lambda 工程师详解本地推理装机:27B 模型需 24-32GB 显存 — TheZachMueller · 2026-09-25
- Pokee AI 现场演示 36B agent 模型跑在 32GB 内存的骁龙笔记本上 — Kyrannio · 2026-09-25
- AMD 讲师亮相 PyTorchCon:1K+ MI355X 上实现 MXFP8 预训练扩展 — PyTorch · 2026-09-25
- AI 能源公司 Parallax 出炉,获 Founders Fund 领投 1.17 亿美元 — graceisford · 2026-09-25
- Nebius/WEKA 实测:分布式 KV cache 让单节点 agent 推理吞吐提升 2.4 倍 — AccBalanced · 2026-09-25
- Burkov AI 周报 #179:GPU 租买账、llm-d 低成本部署 753B 开源模型 — burkov · 2026-09-25