量子位详析GLM InfraAgent:稠密反馈驱动的RSI雏形
量子位 · wechat · 2026-09-17
量子位全文转述智谱唐杰的技术博客,详解 GLM-5.3 驱动的 InfraAgent 在 10 万卡国产集群上参与搭建生产级推理系统的技术细节。GLM-5.3-Flash 全部线上推理运行于该系统,曾以匿名名 Ox-Alpha 上线 OpenCode 与 OpenRouter,6 天 token 调用量超 62 万亿。
核心技术是「稠密反馈」机制:将正确性测试、执行 Trace、微基准测试组织进 Agent 迭代流程,要求反馈局部、低成本及时、可客观验证,解决端到端指标无法解释「为什么变差」的问题。三个案例展示了闭环效果:
- 正确性:Agent 发现 KDA 上下文并行路径中 TF32 默认精度导致长上下文误差累积,改用 tf32x3 修复,合并至 FlashLinearAttention 上游;
- 系统行为:Agent 定位 DeepEP v1.2.1 的 intranodedispatch/combine 未释放 Python GIL,阻塞 MooncakeTransfer 线程,修复后 Prefill+KVTransfer 与单独 Prefill 的性能差距从超 20% 降到 1% 以内;
- 性能优化:Agent 从 SGLang、FlashLinearAttention 等项目提炼「优化骨架」,重组 Decode Kernel 消除四次重复归一化,获 1.71 倍提升。
智谱强调尚未实现 RSI:目标设定、边界划分和风险判断仍由人类负责,但每次 Agent 完成工程任务都可能成为下一代模型的训练数据。
所属事件:智谱披露RSI最小闭环:GLM-5.3智能体两周搭好10万卡国产推理栈(9 条相关)→
「漫话AGI」频道最新
- 用私服魔兽世界当 AI 通用智能测试场:完美沙盒且无法逃逸到现实 — djcows · 2026-09-17
- 18 年前的小说简介被自己读出「LLM 味」,语言审美正在被 AI 改写 — erikphoel · 2026-09-17
- OpenAI 攻克数学难题,25 位菲尔兹奖得主联名警告风险 — nordicinst · 2026-09-17
- AI 安全承诺「2030 年前」见效?从业者吐槽并不安心 — FlorianGallwitz · 2026-09-17
- Nate Silver 表态对 RSI 持怀疑,卷入超级智能争论 — dhadfieldmenell · 2026-09-17
- Timothy Lee 深度访谈:如何思考 AI 安全与「杀人机器人」风险 — binarybits · 2026-09-17