#AI
AWS 发布 HyperPod 推理网关,首 token 延迟降 82%
AWS 发布 Amazon SageMaker HyperPod Inference Gateway,一个 Kubernetes 原生、GPU 感知的推理路由 addon,以 EKS 托管插件 amazon-sagemaker-hyperpod-inference 形式装进现有 HyperPod 集群。
💡 为什么值得看K8s 原生 GPU 感知路由,不改模型服务与客户端就能装;跑多模型、LoRA 共享基座的团队值得看一眼。
查证
来源档案
AWS Machine Learning Blog
AWS 官方产品发布博文,含架构说明、安装命令、CRD 示例与自家基准数据表。
产品存在、形态与可用区域以官方口径为准,可信;但全部性能数字(AWS 自称默认配置下测得)均为厂商自测,没有第三方复现,横向对比也仅限 Kubernetes 轮询基线。
延伸阅读
六种负载条件下的 TTFT P95/P99 与吞吐变化,能看出这套路由在哪些场景真值钱、哪些场景开不开一样。