#AI
AWS 把 NVRx 容错接进 EKS 上的 FSDP 训练
AWS 在机器学习和 AI 博客上放出一篇实操向文章:把 NVIDIA Resiliency Extension(NVRx)接进跑在 Amazon EKS 上的 PyTorch FSDP 训练。
文章点出的痛点是两处空转——单个 GPU 故障经 NCCL 超时级联到健康 worker,以及同步 checkpoint 让所有 rank 阻塞在 I/O 上。按文中说法,后者在这种集群规模下最多吃掉 **40% 的总 wall time**。
💡 为什么值得看异步写盘压缩同步 checkpoint 耗时,H100 实测。
查证
来源档案
AWS Machine Learning Blog
云厂商官方技术博客,属于工程实操 + 自测基准的发布形态,代码与 Terraform 配置随文给出
一手官方来源,架构与 API 细节可信;但性能数字(AWS 自家集群、AWS 自家存储 FSx for Lustre 上的自测 benchmark)天然带厂商立场,转述时应保留其自测属性
延伸阅读
in-process 管软故障、ft_launcher 管硬 kill、编排层管节点丢失,三者独立可分别采用——想知道自己集群该上哪一层的直接看原文章节划分。
文章给了从 torch.save 换到 async_save 的最小 diff,以及 finalize_async_save 的收尾时机,是能直接抄进现有 FSDP 脚本的部分。