AWS 发布技术文章,介绍如何把 NVIDIA Resiliency Extension 集成进 Amazon EKS 上的 PyTorch FSDP 训练流程,用异步检查点把 I/O 与训练重叠,并用进程内重启和 ft_launcher 作业内重启分别应对软故障与硬故障。文章给出 2 至 8 节点 H100 的基准结
AWS 详解在 Amazon EKS 上用 NVRx 实现容错分布式训练