本地跑 1 亿 token 的 GLM 5.2 只花 1 美元
_akhaliq · x · 2026-07-27
在本地用 GLM 5.2 NVFP4 跑了 1 亿多 token,电费只要大约 1 美元。
配图里的成本面板显示总费用约 $1.006992、token 数约 100.63M。帖子想表达的是:当模型和量化格式足够高效时,推理成本正在逼近“几乎免费”。
「Infra」频道最新
- Sparrow 标准模式改用 Ministral 3 14B 做本地抽取 — andrejusb · 2026-07-27
- Wistron 在德州投产 7 亿美元工厂,量产 Nvidia GB300 与 Vera Rubin — Beth_Kindig · 2026-07-27
- BeeLlama.cpp 新增 KV cache 精度尾段和量化档位 — Anbeeld · 2026-07-27
- Cloudflare 的 AI training 拦截可能连 Googlebot 也挡住 — daluoseo · 2026-07-27
- 一个自托管代理把 424 个模型接到同一接口 — ranadheer535 · 2026-07-27
- 长短滑窗注意力让长上下文训练每步快 3 毫秒 — gordic_aleksa · 2026-07-27