IBM 用 llm-d 在 544 块 H100 上跑 753B MoE,服务 3000 个并发编程 Agent
dl_weekly · x · 2026-09-16
IBM Research 与 Red Hat 发布 llm-d 基准报告:在 544 块 NVIDIA H100 上部署约 753B 参数(39B 激活)的开源 MoE 模型 GLM-5.2,同时服务 3,000 个并发编程 agent,85.2% 的输入 token 由缓存命中提供,成本比商用 API 低 5-10 倍。
- Agent 负载特征:反复处理超大上下文、跨交互复用信息、并行子 agent 产生不可预测的突发流量,以「读上下文」而非「生成文本」为主,对延迟、显存、吞吐、成本都是新挑战。
- llm-d 是 IBM Research、Red Hat、Google 等主导的开源推理框架,回应企业在 token 成本上涨与数据私有所迫下自建开源模型服务的需求。
- 结论:企业可在现有 H100 集群上支撑今天的 agentic 流量,不必全面换卡。
「编程与Agent」频道最新
- Radio 发布:一个让不同厂商 Agent 直接对话的共享聊天室 — rohanpaul_ai · 2026-09-16
- Celesto 开源:给 Agent 一个一次性的完整 macOS 桌面 — aniketmaurya · 2026-09-16
- 从业者议 agent 访问层:密码与个人上下文才是真正痛点 — jeff_weinstein · 2026-09-16
- Stripe 电商实测:7 个模型开店 5 个出自 Claude — bcherny · 2026-09-16
- 新员工入职三周交付五个项目:靠 /hq-sync 继承团队上下文 — jacob_posel · 2026-09-16
- Anthropic 发布模型硬件标准预览,让 AI 智能体直接操控实验室设备 — ivan_bezdomny · 2026-09-16