#AI
SageMaker 训练任务支持实例偏好列表
AWS 给 SageMaker AI 的训练与处理任务加了实例偏好列表:创建任务时不再只填一个实例类型,而是给出一份**最多 5 个实例类型的有序列表**,SageMaker AI 按优先级逐个评估,在第一个有可用容量的类型上启动。
官方把这件事的动机讲得很直白 —— 峰值需求期抢不到心仪的 GPU,任务绑死在单一配置上就只能等,或者靠团队自己写重试脚本四处试探。
💡 为什么值得看AWS 把「等 GPU」的手工重试脚本收进平台:一次 API 最多给 5 个实例类型,按序抢容量。
查证
来源档案
AWS Machine Learning Blog
AWS 官方产品公告,含特性说明与 Python SDK v3(ModelTrainer / Processor)代码示例。
官方一手来源,功能范围、上限数字(MaxPendingTimeInSeconds、5 个实例类型)可信;但公告属厂商自述,未给出客户实测的启动时长或利用率提升数据。
延伸阅读
Training Plan 挂到偏好项、失败后回落按需的完整配置写法,以及 MaxPendingTimeInSeconds 在混合实例族下的边界行为,只有官方公告写全。