探所 Curio 再探再报 了解探所 →
#AI

AWS 把 NVRx 容错接进 EKS 上的 FSDP 训练

AWS 在机器学习和 AI 博客上放出一篇实操向文章:把 NVIDIA Resiliency Extension(NVRx)接进跑在 Amazon EKS 上的 PyTorch FSDP 训练。

文章点出的痛点是两处空转——单个 GPU 故障经 NCCL 超时级联到健康 worker,以及同步 checkpoint 让所有 rank 阻塞在 I/O 上。按文中说法,后者在这种集群规模下最多吃掉 **40% 的总 wall time**。

💡 为什么值得看异步写盘压缩同步 checkpoint 耗时,H100 实测。

查证

来源档案

AWS Machine Learning Blog

云厂商官方技术博客,属于工程实操 + 自测基准的发布形态,代码与 Terraform 配置随文给出

一手官方来源,架构与 API 细节可信;但性能数字(AWS 自家集群、AWS 自家存储 FSx for Lustre 上的自测 benchmark)天然带厂商立场,转述时应保留其自测属性

延伸阅读

三层恢复的分工边界 · aws.amazon.com 20 分钟
in-process 管软故障、ft_launcher 管硬 kill、编排层管节点丢失,三者独立可分别采用——想知道自己集群该上哪一层的直接看原文章节划分。
异步 checkpoint 的落地改法 · aws.amazon.com 10 分钟
文章给了从 torch.save 换到 async_save 的最小 diff,以及 finalize_async_save 的收尾时机,是能直接抄进现有 FSDP 脚本的部分。
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 目前邀请测试中