#AI
AWS 详解 Bedrock 提示缓存:重复上下文省 90% 输入成本
AWS 官方博客发布了一篇 Amazon Bedrock prompt caching 的实操长文,内核口径是:反复发送同一段上下文时,输入 token 成本最多可降低 **90%**。
文章用的是 Converse API,给了六个从基础到进阶的场景 —— 消息内容缓存、system prompt 缓存、tool definition 缓存、混用 TTL、多租户隔离,以及 LangChain 集成,覆盖长文档多轮提问、RAG 和 agentic 工作流这类重复上下文的典型负载
💡 为什么值得看重复上下文按缓存读计费可省 90%,写缓存加价 25%,典型场景净省约 75%;这是 agent 与 RAG 成本核算的实操口径。
查证
来源档案
AWS Machine Learning Blog
AWS 官方技术博客,属于一手发布源,文章主体是可运行的代码示例与官方定价口径。
定价与 token 门槛、TTL 规则均引自官方文档与定价页,可直接作为成本估算依据。需注意「最多 90%」是缓存命中的单次读取折扣,不等同于整体账单降幅 —— 实际净省取决于命中率与请求是否落在 TTL 内。本组只有这一个来源,无第二方独立复述。
延伸阅读
缓存按 AWS 账户与区域隔离,多租户应用的 cachePoint 切分方式直接决定缓存命中率和租户数据边界;文章给的是可运行代码,不只是概念说明。