GLM 5.2 跑出 35t/s 生成速度,DwarfStar 实现 Agent 级推理
antirez · x · 2026-08-22
Antirez 报告了在 DGX Station 上的最新进展:使用 DwarfStar 混合 RAM/VRAM 推理技术,成功运行了 4bit 量化、总重 500GB 的 GLM 5.2 模型。实测生成速度达 35 tokens/s,预填充速度 2000 tokens/s(预计 soon 提升至 3k)。结论是该方法完全可以支撑前沿开源权重模型以 Agent 可用的速度运行。
「Infra」频道最新
- 技术解析:Pi 编程 Agent 的压缩机制如何工作 — bibryam · 2026-08-22
- 光阳钢厂规模惊人,揭露数据中心环保争论的贫乏 — AndyMasley · 2026-08-22
- 新基准测试揭示启用统一内存可显著提升本地大模型显存利用率 — Pablo_the_brave · 2026-08-22
- OpenAI 收购后端方案商 Instant,强化 AI 应用基建 — testingcatalog · 2026-08-22
- AMD V620 显卡跑 Qwen 27B 与 Gemma A4B 基准测试结果 — Brave_Load7620 · 2026-08-22
- H100 缺货需等一年,算力瓶颈实为电力冷却与人才 — ingliguori · 2026-08-22