GLM-5.2 已能在戴尔工作站本地跑到 40 tokens/s
pcuenq · x · 2026-07-28
- Michael Dell 晒出一段演示:GLM-5.2 这个 753B 参数模型,已经能在搭载 GB300 的 Dell Pro Max 上本地跑到 40 tokens/s。
- 这条帖子的核心观点不是“人人都能本地跑”,而是:这类前沿模型会先被各家服务商高效托管,再被昂贵的本地/云端机器拿去 蒸馏 成更小的模型。
- 也就是说,真正变化的是模型分发链路:大模型先成为教师,小模型再落到普通人可用的硬件上。
- 结合图片里的实机演示,帖子强调的是前沿智能正在从数据中心向个人设备渗透。
「Infra」频道最新
- Nvidia、Microsoft 等公司加入 Open Secure AI 联盟 — Dapper_Order7182 · 2026-07-28
- Nvidia 7500 亿美元 AI 交易引爆循环融资担忧 — brainquantum · 2026-07-28
- SSI与亚马逊签4.1亿美元算力大单,占其融资总额大部分 — TechCrunch AI · 2026-07-28
- 台湾拘留英伟达员工,涉嫌非法出口超微AI服务器至中国 — The Decoder · 2026-07-28
- RBC 称自建 AI 替代 Office 五年成本可高 11 倍 — TiernanRayTech · 2026-07-28
- LangChain 称与 NVIDIA 合作帮助企业掌握领域知识 — LangChain · 2026-07-28