3000 会话 300 亿 token 实测:模型真正输出只占 0.3%,97% 输入来自缓存
Rare_Guide_9830 · reddit · 2026-09-14
一位开发者发现 Claude Code 和 Codex 会把每个会话以 JSONL 写到本地磁盘(含每次响应 token 数、工具调用及结果、所用模型、上下文压缩位置),于是做了本地工具,把数据解析进 SQLite 提供全文搜索和 UI。
他今年数据的惊人结论:
- 3,171 个会话、记录 301 亿 token,但只有 9,270 万是生成输出——仅 0.3%
- 112,849 次模型响应,97.3% 的输入由缓存服务
- 0.3% 是量不是钱:输出计费单价约为缓存输入的 50 倍,量与成本分布完全不同
机制解释:每轮都重发全部对话历史直到压缩,输出保持平缓而输入复利式增长,几百轮后比例悬殊——agent 读的远多于写的,且每轮都要再付一遍阅读成本。
意外发现:3,171 次工具调用失败(共 11.6 万次调用),此前从未察觉;部分失败形成了耗尽额度的循环,95% 发生在子 agent 进程中。
「编程与Agent」频道最新
- WebMCP 浏览器工具实测:Books 任务省一半 token,X 任务反而更费 — j032 · 2026-09-14
- DeepDeck 上线 WebMCP 工具目录:源码可查、版本可锁定,已有三个站点工具 — j032 · 2026-09-14
- Agora 发布教程:用编码 Agent 搭建自己的语音 AI 应用 — Embarrassed-Bend7110 · 2026-09-14
- Claude Code 驱动视频 CLI 的坑:服务器报错≠生成失败,重复提交白花钱 — letandrewcook · 2026-09-14
- Desktop Commander 让 ChatGPT Pro 直连本地终端写代码 — RileyRalmuto · 2026-09-14
- 开源项目 Webagent:给网站几分钟造出可对话的公开 Agent — Scobleizer · 2026-09-14