探所 Curio 再探再报 了解探所 →
#AI

AWS 发布 HyperPod 推理网关,首 token 延迟降 82%

AWS 发布 Amazon SageMaker HyperPod Inference Gateway,一个 Kubernetes 原生、GPU 感知的推理路由 addon,以 EKS 托管插件 amazon-sagemaker-hyperpod-inference 形式装进现有 HyperPod 集群。

💡 为什么值得看K8s 原生 GPU 感知路由,不改模型服务与客户端就能装;跑多模型、LoRA 共享基座的团队值得看一眼。

查证

来源档案

AWS Machine Learning Blog

AWS 官方产品发布博文,含架构说明、安装命令、CRD 示例与自家基准数据表。

产品存在、形态与可用区域以官方口径为准,可信;但全部性能数字(AWS 自称默认配置下测得)均为厂商自测,没有第三方复现,横向对比也仅限 Kubernetes 轮询基线。

延伸阅读

基准表怎幺读 · aws.amazon.com 5 分钟
六种负载条件下的 TTFT P95/P99 与吞吐变化,能看出这套路由在哪些场景真值钱、哪些场景开不开一样。
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 目前邀请测试中