长上下文下仍有 313 tok/s
casper_hansen_ · x · 2026-07-15
帖子提到,当上下文长度进入 10 万到 20 万 token 区间时,速度会有所下降,但平均仍能达到 **313 tokens/s**,作者认为这个表现“相当不错”。 信息核心是:长上下文场景下的吞吐下降是预期内的,但当前速度仍然可用,暗示相关推理/服务栈的性能表现。
「Infra」频道最新
- 黄仁勋东京会见日本半导体高层 — nvidia · 2026-07-21
- Infinity 启动并融资 1500 万美元 — mmmbchang · 2026-07-21
- 如何参与Stratum并获取$STRAT — rsalakhu · 2026-07-21
- LLM每token能耗或已低于人脑 — jd_pressman · 2026-07-21
- Couchbase 的多模型 AI 架构实践 — AWS ML Blog · 2026-07-21
- 一天实测Kimi K3:上限高但代价大 — Tarandjpop · 2026-07-21