上下文压缩省错层:真正账单是整段重发和缓存写

KitchenAmoeba4438 · reddit · 2026-07-25

上下文压缩常常省错了地方

这篇文章的核心观点是:在工具调用/智能体循环里,真正烧钱的不是最新那段被压缩的文本,而是每次请求都要整段重发的上下文。

作者还强调,单看 token 数很容易误判,应该同时跟踪 cachecreation 和 cacheread,并用成对实验衡量“每个成功任务的真实成本”。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →