Bedrock Prompt Caching 实战:命中缓存输入 token 最高省 90%

AWS ML Blog · rss · 2026-09-16

AWS ML Blog 发布 Amazon Bedrock prompt caching 完整教程:对重复上下文(系统提示、长文档、工具定义)做前缀缓存,缓存命中时输入 token 成本最高降 90%,TTFT 也显著降低。重复上下文工作负载整体可省约 75% 输入成本。

要点:

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →