3000 会话 300 亿 token 实测:模型真正输出只占 0.3%,97% 输入来自缓存

Rare_Guide_9830 · reddit · 2026-09-14

一位开发者发现 Claude Code 和 Codex 会把每个会话以 JSONL 写到本地磁盘(含每次响应 token 数、工具调用及结果、所用模型、上下文压缩位置),于是做了本地工具,把数据解析进 SQLite 提供全文搜索和 UI。

他今年数据的惊人结论:

机制解释:每轮都重发全部对话历史直到压缩,输出保持平缓而输入复利式增长,几百轮后比例悬殊——agent 读的远多于写的,且每轮都要再付一遍阅读成本。

意外发现:3,171 次工具调用失败(共 11.6 万次调用),此前从未察觉;部分失败形成了耗尽额度的循环,95% 发生在子 agent 进程中。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →