探所 Curio 再探再报 了解探所 →
#AI

AWS 演示 Bedrock 查询感知压缩降本

AWS 在机器学习博客发布一套**查询感知上下文压缩**方案,解决 RAG 规模化后输入 token 成本过高的问题。

内核思路:在矢量检索之后、主模型(Claude Sonnet)生成答案之前,先让一个更便宜的小模型(Claude Haiku)把检索到的 chunks 按查询过滤一遍,只保留逐字相关的片段(verbatim spans)再交给主模型。

💡 为什么值得看官方实测:成本降 33%,输入 token 减 8.6 倍,质量持平,可直接落地。

查证

来源档案

AWS Machine Learning Blog

AWS 官方的产品技术博客,由厂商自己发布,属于一手公告性质

厂商自报的评测数据,数字可信但口径上有自利倾向(结果声明\"不同语料会不同\");作为工程参考值可接受,落地时需在自己数据上复测

延伸阅读

照抄落地 · aws.amazon.com
全文含 COMPRESSION_SYSTEM_PROMPT 完整提示词与 Lambda 实现代码,直接可移植到自己的 Bedrock RAG 链路
成本模型公式 · aws.amazon.com
文末给出 baseline vs 压缩的逐项成本对照表,想算自己场景下能否回本(压缩省下的主模型输入费是否覆盖小模型开销)看这一节
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 即将上架 App Store