开源模型使用量无法精确统计,推理商 token 数成最佳估算依据
xeophon · x · 2026-09-20
在关于开源模型实际使用量的争论中,xeophon 反驳 OpenRouter 数据可作为基准的说法,指出开源本质上是去中心化系统,永远无法精确测量其使用量。他给出的最佳估算法是:估算大型闭源实验室的算力规模,再推断其余部分有多少跑开源模型。他同时提到 HF 下载量快速增长,Together、Baseten、Fireworks 等推理服务商的 token 消耗也在快速上升。
「Infra」频道最新
- Vulkan 本地训练器 VTrain 修复内存泄漏,更多负载转移至 GPU — Savantskie1 · 2026-09-20
- vLLM 首日支持 Qwen-Image-2.1:KV cache 复用加速推理,附部署指南 — Alibaba_Qwen · 2026-09-20
- 开发者因 ComfyUI 在 Mac 上太慢,自建 Apple Silicon 本地模型启动器 — janishar · 2026-09-20
- vLLM-Omni 发布:KV 复用、FP8 等多项优化加速全模态推理 — vllm_project · 2026-09-20
- 用 ARM SVE2 指令加速 JSON 解析,simd 已合入实测 — lemire · 2026-09-20
- GLM 5.3 Flash NVFP4 量化版跑进 ChatGPT 本地体验 — TheZachMueller · 2026-09-20