GLM 5.2 跑出 35t/s 生成速度,DwarfStar 实现 Agent 级推理

antirez · x · 2026-08-22

Antirez 报告了在 DGX Station 上的最新进展:使用 DwarfStar 混合 RAM/VRAM 推理技术,成功运行了 4bit 量化、总重 500GB 的 GLM 5.2 模型。实测生成速度达 35 tokens/s,预填充速度 2000 tokens/s(预计 soon 提升至 3k)。结论是该方法完全可以支撑前沿开源权重模型以 Agent 可用的速度运行。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →