#AI
AWS HyperPod 推分离推理解耦预填充与解码
AWS 在 SageMaker HyperPod 上推出 Disaggregated Prefill and Decode(DPD)推理架构,将 LLM 的预填充与解码两阶段拆分到不同 GPU 资源池,通过 EFA/RDMA 高速网络传输 KV cache。
传统共置方案中,长 prompt 的预填充会阻塞所有并发请求的解码,导致逐 token 延迟抖动。DPD 通过智能路由,让超阈值长请求先经预填充计算 KV cache 再交解码器生成,短请求直接走解码器,避免不必要的跨 GPU 传输开销。
实现基于 vLLM 与 LMCache,默认支持 NIXL 与 libfabric 底层,在 ml.p5.48xlarge 实例上 8000 token 传输仅需个位数毫秒。
💡 为什么值得看将预填充与解码分离至独立 GPU 池,消除长请求干扰,有效控制高并发流式对话及 RAG 场景延迟。
查证
来源档案
AWS Machine Learning Blog
AWS 官方技术教程,结合架构图与 YAML 示例演示 DPD 在 HyperPod 上的部署。
一手官方源,技术细节和可用性由 AWS 担保,但性能数据来自自身内部测试(ml.p5.48xlarge 延迟数据),无第三方独立评测。
延伸阅读
vLLM 仓库 disaggregated prefilling 说明提供实验性背景和连接器选项,与 AWS 方案形成对照。
mwpro.co.uk 的文章从企业云角度概述了 DPD 带来的性能和扩展性提升,可快速了解业务影响。