探所 Curio 再探再报 了解探所 →
#AI

SageMaker 上线前缀感知路由,TTFT 降 77%

AWS 在 Amazon SageMaker Inference 上推出了 prefix-aware routing(前缀感知路由)。逻辑很直白:LLM 请求的开头往往是一大段固定内容 —— 系统提示、参考文档、多轮历史,后面才跟用户那几十个 token 的输入。

这类前缀被 vLLM 等框架缓存成 KV pairs 后本可跳过重算,但请求一旦被随机分散到多台实例,每台都看不到足够的重复前缀,缓存就建不起来。新策略让**相同开头的请求落到同一台实例**,缓存才真正热起来。

💡 为什么值得看系统提示反复重算是自建 LLM 的常见浪费,这条路由真正用起了 KV 缓存。

查证

来源档案

AWS Machine Learning Blog

AWS 官方产品博客,含功能说明、启用参数与自建 benchmark 数据。

功能已上线、参数与 API 用法属官方一手信息,可信;性能数字来自 AWS 自己的压测环境,无第三方复现,当作厂商口径看待。

延伸阅读

自建推理服务能不能抄这条路由 · aws.amazon.com 5 分钟
文里给了 PrefixLength 与 ConcurrencyThreshold 的取值权衡(太短会把请求挤到一台实例触发溢出,太长会让 temperature 这类小差异把本该同组的请求打散),做自建 vLLM 服务的人可以对着这两条调参。
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 即将上架 App Store