AWS 发布 SageMaker HyperPod 推理的模型缓存功能,可将模型权重与推理容器镜像预加载到集群节点本地 NVMe 存储,使 Pod 启动时无需再从网络下载。官方称权重缓存可让扩容速度提升约 60%,镜像缓存可减少两分钟以上拉取时间,并给出启用方式、支持的模型来源与 NVMe 容量等限制。
AWS 为 SageMaker HyperPod 推理推出模型缓存,冷启动从数十分钟降至秒级