探所 Curio 再探再报 了解探所 →
#AI

AWS 详解 Bedrock 提示缓存:重复上下文省 90% 输入成本

AWS 官方博客发布了一篇 Amazon Bedrock prompt caching 的实操长文,内核口径是:反复发送同一段上下文时,输入 token 成本最多可降低 **90%**。

文章用的是 Converse API,给了六个从基础到进阶的场景 —— 消息内容缓存、system prompt 缓存、tool definition 缓存、混用 TTL、多租户隔离,以及 LangChain 集成,覆盖长文档多轮提问、RAG 和 agentic 工作流这类重复上下文的典型负载

💡 为什么值得看重复上下文按缓存读计费可省 90%,写缓存加价 25%,典型场景净省约 75%;这是 agent 与 RAG 成本核算的实操口径。

查证

来源档案

AWS Machine Learning Blog

AWS 官方技术博客,属于一手发布源,文章主体是可运行的代码示例与官方定价口径。

定价与 token 门槛、TTL 规则均引自官方文档与定价页,可直接作为成本估算依据。需注意「最多 90%」是缓存命中的单次读取折扣,不等同于整体账单降幅 —— 实际净省取决于命中率与请求是否落在 TTL 内。本组只有这一个来源,无第二方独立复述。

延伸阅读

多租户与混合 TTL 场景 · aws.amazon.com 20 分钟
缓存按 AWS 账户与区域隔离,多租户应用的 cachePoint 切分方式直接决定缓存命中率和租户数据边界;文章给的是可运行代码,不只是概念说明。
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 目前邀请测试中