GLM-5.3-Flash 跑在 10 万+国产加速器上,infra agent 两周把吞吐提升 3 倍
JeremyCMorgan · x · 2026-09-26
Jeremy Morgan 介绍了一个大规模推理服务案例:
- GLM-5.3-Flash 已在 10 万+中国国产加速器上提供推理服务,大量调优工作由一个 infra agent 完成。
- 两周内吞吐量提升 3 倍。
- 可复用的关键经验不是单一聚合指标,而是密集反馈:正确性测试、trace 和 microbenchmark,用它们驱动 agent 持续优化。
对做大规模推理栈和用 agent 做性能调优的团队都有参考价值。
「编程与Agent」频道最新
- theo 批评 OpenRouter 接入 Jev:不推理只分类,难判任务复杂度 — intellectronica · 2026-09-26
- Reddit 讨论:如何让 Agent 真正用好你的 MCP 工具集 — onehundredemoji69 · 2026-09-26
- 本想做 155 个 MCP 工具,算完 token 账只留了 10 个 — Difficult_Coffee_713 · 2026-09-26
- 免费开源 harness 工程课:同一 Opus 4.5 花 $200 才跑通游戏编辑器 — JafarNajafov · 2026-09-26
- OpenAI 文档上线电话外呼能力,AI 可直接拨打号码代你通话 — imjustnewatai · 2026-09-26
- You.com 用 Jev 做重排层:token 省 3 倍、RTK 基准 84% 准确率 — PolarBearby · 2026-09-26