4卡 DGX Spark 实测:GLM-5.2 推理飙至 44.6 tok/s
EAccelerate_42 · x · 2026-08-11
开发者分享了在 4 节点 NVIDIA DGX Spark (GB10) 集群上部署 GLM-5.2 的最优配置。他强调该配置并非为刷分而生,而是完全基于真实的智能体编码工作负载进行调优。
目前该集群实现了 44.6 tok/s 的单流解码速度,相比两天前的 5.7 tok/s 实现了大幅跨越。关键提升来自于社区此前一直忽视的一个环境变量设置,相关代码与调优细节已开源。
「编程与Agent」频道最新
- Agent 浏览器静默失败:工具返回成功但副作用未发生,如何验证? — Downtown_Item_9996 · 2026-08-11
- 开源 SkillNet:搜索、安装并评估可复用 AI Agent 技能 — tom_doerr · 2026-08-11
- 开发者从零构建 AI 电商创意系统:图生图、测试与评估实战 — aishashok14 · 2026-08-11
- 实测 Claude Code:自动生成后续任务卡片功能体验 — dotey · 2026-08-11
- 用代码重构 3D 场景:Agent 实时对比与编辑工作流 — joemeno · 2026-08-11
- BlackHat 警告:Agent 已存在 171 种通信逃逸方式 — Ghost_Pilot_MD · 2026-08-11