本地模型跑分该不该算冷启动?首请求延迟常被忽略
Greedy-Badger-8463 · reddit · 2026-10-01
作者指出本地模型评测的一个常见盲区:热身状态下的数字好看,但重启应用后首个请求要等很久。他提议交互类应用的 benchmark 应同时给出冷启动与热启动两组数据,并询问大家在实践中到底测哪个——两者各有意义,只是适用场景不同。
「Infra」频道最新
- 华为 Mate 90 发布:麒麟 9050 Pro 首用 LogicFolding 架构 — ingliguori · 2026-10-01
- A20 标准版疑不用 WMCM 封装,爆料的回应只有三个字:产能不够 — zephyr_z9 · 2026-10-01
- TRL 月训练量破 100 万次,团队瞄准每周百万 — QGallouedec · 2026-10-01
- oMLX 0.7.0 发布:长上下文解码提速 50%,重写内存守护 — pcuenq · 2026-10-01
- SlideDP:4 张 RTX 4090 微调 Qwen2.5-72B,吞吐超 FSDP2 11.2% — Ruijia Yang · 2026-10-01
- 中国单月用电量创历史新高,但工业电力需求增速放缓 — teortaxesTex · 2026-10-01