Sentdex:本地跑了 40 亿 token,GLM 5.3 Flash 成其最常用本地模型
Sentdex · x · 2026-09-29
知名 ML YouTuber Sentdex 表示已在本地用 GLM 5.3 Flash 处理超过 40 亿 token,称这是他有史以来用得最多的本地模型。来自重度本地部署用户的真实用量背书,对端侧/本地推理生态是个积极信号。
「Infra」频道最新
- 单卡 DGX Spark 跑 Qwen3.8 Flash 212 tok/s,作者开源完整 vLLM 配方 — DimeRhyme · 2026-09-29
- Reddit 热议:千元级本地跑 SOTA 模型的设备是下一个大机会 — Robert__Sinclair · 2026-09-29
- SemiAnalysis:6000 个数据中心项目仅 3 个受暂停令影响 — MatthewBerman · 2026-09-29
- Cloudflare 生日周开源大礼包:forge、vinext 1.0、Rust Workers 等 8 项更新 — ritakozlov · 2026-09-29
- 谷歌趋势美国区榜首全是怀俄明州?作者疑因数据中心机器流量 — lilyraynyc · 2026-09-29
- kipply 推出推理成本算术教程,拆解 H200/B200 上的 prefill 与 decode 开销 — ycombinator · 2026-09-29