GLM-5.2 推理争论:750B 参数怎么跑过 1 token/s
francoisfleuret · x · 2026-07-21
被引用的原帖在问一个很具体的推理带宽问题:如果 GLM-5.2 有 750B 参数、40B active,大约相当于 20GB,那即便顶级 SSD 理论带宽也才 15GB/s,怎么可能做到 1 token/s 以上?
这条转发本身没有把答案展开,而是说他希望能把收到的回复整理一下,顺手纠正原帖里的误解。整体看,核心仍然是模型服务吞吐/带宽瓶颈这类基础设施话题。
「Infra」频道最新
- Tesla FSD v14 Lite 预计推向 400 万辆旧 HW3 车 — MatthewBerman · 2026-07-21
- 台积电 3nm 利用率据称超 120%,AI 需求推高 1900 亿美元资本开支 — tengyanAI · 2026-07-21
- Nativ 用桌面应用和本地 API 把模型带到 Mac 上 — Simon Willison · 2026-07-21
- Octen称Agent搜索P50仅62毫秒,P90差距只有6毫秒 — aakashgupta · 2026-07-21
- 智谱收购编译器团队,押注国产芯片推理优化 — zephyr_z9 · 2026-07-21
- Meta 的 REWIRE 数据流水线开源复现成本仅约 11 美元 — vanstriendaniel · 2026-07-21