实测 28 万次 API:百万级上下文是 Token 消耗陷阱
_rchaves_ · x · 2026-08-03
通过对 2,451 个编程智能体(Coding Agent)会话和 287,748 次追踪 API 调用的深度分析,作者指出盲目追求超大上下文窗口(如 1M tokens)是“大厂设下的 Token 消耗陷阱”。
核心发现
- 成本呈指数级增长:上下文大小每翻倍,Token 消耗成本大约增加 6 倍。因为在 500k 上下文时执行 25 次工具调用,实际消耗是 25 × 500k tokens,而非单次请求。
- 有效信息利用率极低:16 倍的上下文窗口增长,带来的实际可用上下文信息量几乎没有增加。
- 最佳压缩节点:建议在 250k 到 450k tokens 之间进行上下文压缩(compact)。
- 压缩的质量代价:压缩后的一段时间内,智能体会做出明显更差的决策。但综合长期成本与偶尔的失误成本来看,依然无法证明让智能器在接近 1M 窗口下运行是划算的。
所属事件:海量实测数据揭示:百万级上下文窗口或为 Token 陷阱(2 条相关)→
「编程与Agent」频道最新
- 开发者工作流:GPT 负责写代码,Claude 负责做审查 — mobileraj · 2026-08-03
- 开源 80 个专家 Agent Skills:让编码助手模仿名人思维 — tom_doerr · 2026-08-03
- 开源工具 Gradian:精准定位导致 LLM 微调失败的“毒数据” — vylara-ai · 2026-08-03
- Echoverse:让智能体在深度环境中进化,9B模型成功率飙升至67% — burny_tech · 2026-08-03
- 瑜伽工作室聊天机器人架构:多模型路由与低成本记忆方案 — omi0009 · 2026-08-03
- Autoexp: 本地优先的 AI 实验记录与追踪工作空间 — Southern-Whereas3911 · 2026-08-03