#AI
AWS 演示 Bedrock 查询感知压缩降本
AWS 在机器学习博客发布一套**查询感知上下文压缩**方案,解决 RAG 规模化后输入 token 成本过高的问题。
内核思路:在矢量检索之后、主模型(Claude Sonnet)生成答案之前,先让一个更便宜的小模型(Claude Haiku)把检索到的 chunks 按查询过滤一遍,只保留逐字相关的片段(verbatim spans)再交给主模型。
💡 为什么值得看官方实测:成本降 33%,输入 token 减 8.6 倍,质量持平,可直接落地。
查证
来源档案
AWS Machine Learning Blog
AWS 官方的产品技术博客,由厂商自己发布,属于一手公告性质
厂商自报的评测数据,数字可信但口径上有自利倾向(结果声明\"不同语料会不同\");作为工程参考值可接受,落地时需在自己数据上复测
延伸阅读
全文含 COMPRESSION_SYSTEM_PROMPT 完整提示词与 Lambda 实现代码,直接可移植到自己的 Bedrock RAG 链路
文末给出 baseline vs 压缩的逐项成本对照表,想算自己场景下能否回本(压缩省下的主模型输入费是否覆盖小模型开销)看这一节