Matthew Berman:不报 tokens/s 就说机器能跑哪个模型没有意义
MatthewBerman · x · 2026-10-12
Matthew Berman 发推指出,讨论某台机器「能跑哪个模型」时,如果不说推理速度(tokens per second),这句话没有任何意义。可运行与可用之间的差距全在吞吐率上——同一模型在不同硬件上每秒生成的 token 数可能相差数倍,直接决定体验。这是对近期大量本地部署/端侧跑模型宣传的常见缺口的吐槽。
「Infra」频道最新
- JAX 可跑 Apple GPU:jax-graft 用 Opus 5.5 写成开源后端 — twiecki · 2026-10-12
- GamePause 开源:检测到开游戏自动卸载本地 LLM,释放 17.4GB 显存 — zainfear · 2026-10-12
- 算账:AI 数据中心每花 100 美元,60 美元是 GPU 折旧,电费仅 7 美元 — Ill_Vegetable169 · 2026-10-12
- Runpod Flash 免 Docker 直跑云端 GPU,一条命令部署生成应用 — AI Engineer · 2026-10-12
- 从磁盘流式加载权重对 LLM 不可行,但对决策模型或可热加载即用即卸 — ostrisai · 2026-10-12
- LangChain 创始人:常驻机器是 agent 的弱点,并行跑任务才是正解 — zeeg · 2026-10-12