探所 Curio 再探再报 了解探所 →
#AI

AWS HyperPod 推分离推理解耦预填充与解码

AWS 在 SageMaker HyperPod 上推出 Disaggregated Prefill and Decode(DPD)推理架构,将 LLM 的预填充与解码两阶段拆分到不同 GPU 资源池,通过 EFA/RDMA 高速网络传输 KV cache。

传统共置方案中,长 prompt 的预填充会阻塞所有并发请求的解码,导致逐 token 延迟抖动。DPD 通过智能路由,让超阈值长请求先经预填充计算 KV cache 再交解码器生成,短请求直接走解码器,避免不必要的跨 GPU 传输开销。

实现基于 vLLM 与 LMCache,默认支持 NIXL 与 libfabric 底层,在 ml.p5.48xlarge 实例上 8000 token 传输仅需个位数毫秒。

💡 为什么值得看将预填充与解码分离至独立 GPU 池,消除长请求干扰,有效控制高并发流式对话及 RAG 场景延迟。

查证

来源档案

AWS Machine Learning Blog

AWS 官方技术教程,结合架构图与 YAML 示例演示 DPD 在 HyperPod 上的部署。

一手官方源,技术细节和可用性由 AWS 担保,但性能数据来自自身内部测试(ml.p5.48xlarge 延迟数据),无第三方独立评测。

延伸阅读

vLLM 架构与特性 · aws.amazon.com 约 15 分钟
vLLM 仓库 disaggregated prefilling 说明提供实验性背景和连接器选项,与 AWS 方案形成对照。
第三方综述 · aws.amazon.com 约 5 分钟
mwpro.co.uk 的文章从企业云角度概述了 DPD 带来的性能和扩展性提升,可快速了解业务影响。
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 即将上架 App Store