Bedrock Prompt Caching 实战:命中缓存输入 token 最高省 90%
AWS ML Blog · rss · 2026-09-16
AWS ML Blog 发布 Amazon Bedrock prompt caching 完整教程:对重复上下文(系统提示、长文档、工具定义)做前缀缓存,缓存命中时输入 token 成本最高降 90%,TTFT 也显著降低。重复上下文工作负载整体可省约 75% 输入成本。
要点:
- 定价:写入缓存比标准输入贵 25%(1 小时 TTL 则翻倍),读取缓存便宜 90%;默认 TTL 5 分钟,部分模型支持 1 小时。
- 门槛:Claude Sonnet 4.5/4.6 每个检查点至少 1,024 token,Opus 需 4,096;cachePoint 语法跨模型家族通用(含 Claude 与 Amazon Nova)。
- 六个由浅入深的场景:长文档多问题缓存、系统提示缓存、工具定义缓存、混合 TTL 分层、多租户缓存隔离、LangChain 集成,附完整代码示例。
「Infra」频道最新
- MLPerf Inference v6.1 即将揭晓:30 家提交者与新加速器同台竞技 — TheKanter · 2026-09-16
- Lambda 用 NVIDIA DSX MaxLPS:同功率预算多跑 3 节点,吞吐增 24% — TheZachMueller · 2026-09-16
- NVIDIA 演示 AI 工厂电网调峰:200 次需求信号全部响应成功 — nordicinst · 2026-09-16
- AI Infra Summit:NVIDIA Vera Rubin 与 DSX 主打每瓦 token 效率 — nordicinst · 2026-09-16
- 英伟达发布 DSX AI 工厂平台:榨干每兆瓦算力产出 — nvidia · 2026-09-16
- 320 美元 GPU 跑 125B MoE?网友晒 22 tok/s 本地方案 — cephaloform · 2026-09-16