Anthropic 称 Prompt Caching 可把重复上下文成本降至九折

aitrendz_xyz · x · 2026-07-27

这条重点讲 prompt caching:如果 API 应用里有大量重复上下文,反复重算会很贵;把内容标记为缓存后,后续请求会复用服务端缓存,号称可让缓存 token 最多便宜 90%,同时更快。

帖子还给出具体规则:缓存持续 5 分钟,每次使用会刷新;可用于 system prompt、文档和工具定义,但内容块必须达到最小长度阈值——Sonnet 需要 1,024 token,Opus 和 Haiku 需要 4,096 token,否则不会缓存。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →