Epoch 实测:长上下文下 GPT 延迟弯曲,Claude 保持线性
krishnan · x · 2026-09-16
Epoch AI 9 月 12 日简报发布了一项对长时运行 Agent 设计者很有用的实测结果:同为百万 token 上下文窗口,不同模型家族的延迟曲线差异显著。
- 测量范围:从约 5 万到 90 万输入 token 的首 token 时间(TTFT)。
- GPT-5.6 Terra 与 Sol 的延迟随上下文增长呈明显上扬曲线;Claude Sonnet 5 接近线性,Opus 5 虽噪声较大但弯曲不明显。
- 研究者用三种方法处理 API 延迟噪声,均得到一致的大格局;附录还显示 GPT-6 Astra 仍有显著的二次项成分。
- 机制解释:首 token 输出前模型需完成 prefill 阶段的全注意力计算,需跨上下文比较所有 token,计算量随上下文超线性增长,不同架构的实现差异导致曲线分化。
对需要长上下文、长时运行的 Agent 工作流而言,这一差异直接影响成本与响应设计。
「模型」频道最新
- ChatGPT 语音卡顿、Codex 报错,AGI 前的可靠性短板凸显 — koltregaskes · 2026-09-16
- 实测三大 AI 工作助手订行程:ChatGPT 与 Claude 查酒店双双翻车 — giffmana · 2026-09-16
- 新模型西语能力糟糕,开发者吐槽厂商承诺修复却迟迟不动 — Angaisb_ · 2026-09-16
- 博主指出:多份基准测试的多数错误源自评测本身而非模型 — zainhas · 2026-09-16
- 测试账号曝出「Speech to Speech Index」页面,疑有语音新功能 — testingcatalog · 2026-09-16
- 美国政府被曝用 Qwen 嵌入模型做 RAG 检索 — PsychologicalSoup251 · 2026-09-16