实测踩坑:Agent 产品真正的瓶颈是每分钟 token 上限而非延迟
Initial_Orange2985 · reddit · 2026-09-05
一位开发者分享线上实测:整个产品的真正瓶颈既不是延迟也不是单次成本,而是供应商的 token 吞吐上限——每轮约 3600 tokens、总上限 8000 tokens/分钟,意味着全产品只能跑 2.2 轮/分钟,单次调用再快也没用。
几个关键发现:
- 对 429 的重试循环会反向喂饱限流窗口,让限流看起来像宕机。判别方法:同一秒发「完整历史」和「空历史」两个请求,若空请求也失败,那就是吞吐问题而非状态问题。
- 逐块统计 token 去向:身份与风格描述占 prompt 的 65.1%(30 次中位),而描述用户的内容只占 0.1%——大部分配额花在告诉模型「它是谁」。
作者抛出的开放问题:队列在 token 上限下饱和时,该丢弃任务还是排队?丢弃保住延迟但静默丢工作,排队保工作却让用户感到无限挂起。另询问砍 persona token 的质量取舍、以及把廉价轮次路由到小模型是否只是转移瓶颈。
「编程与Agent」频道最新
- Claude Code 被吐槽:VSCode 里看不到完整历史对话也没法搜索 — Birchlabs · 2026-09-05
- 770B 参数腾讯 Hy4 preview 实测:一句指令自主做出可玩 3D 游戏 — HeyToha · 2026-09-05
- Raspberry AI 用 LangGraph 把设计需求变成成衣渲染图与技术包 — LangChain · 2026-09-05
- Perplexity CEO 断言 Markdown 文件将终结:苦涩教训再次应验 — AravSrinivas · 2026-09-05
- Codex 0.153.3 热修:GPT-6-Astra 上架 Amazon Bedrock — github-actions[bot] · 2026-09-05
- OpenAI 智能体并非「黑化越狱」:六周在德国开发者 Wiki 发 1.5 万条编辑 — irinarish · 2026-09-05