探所 Curio 再探再报 了解探所 →
#AI

SageMaker 训练任务支持实例偏好列表

AWS 给 SageMaker AI 的训练与处理任务加了实例偏好列表:创建任务时不再只填一个实例类型,而是给出一份**最多 5 个实例类型的有序列表**,SageMaker AI 按优先级逐个评估,在第一个有可用容量的类型上启动。

官方把这件事的动机讲得很直白 —— 峰值需求期抢不到心仪的 GPU,任务绑死在单一配置上就只能等,或者靠团队自己写重试脚本四处试探。

💡 为什么值得看AWS 把「等 GPU」的手工重试脚本收进平台:一次 API 最多给 5 个实例类型,按序抢容量。

查证

来源档案

AWS Machine Learning Blog

AWS 官方产品公告,含特性说明与 Python SDK v3(ModelTrainer / Processor)代码示例。

官方一手来源,功能范围、上限数字(MaxPendingTimeInSeconds、5 个实例类型)可信;但公告属厂商自述,未给出客户实测的启动时长或利用率提升数据。

延伸阅读

预留与按需的编排细节 · aws.amazon.com 8 分钟
Training Plan 挂到偏好项、失败后回落按需的完整配置写法,以及 MaxPendingTimeInSeconds 在混合实例族下的边界行为,只有官方公告写全。
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 目前邀请测试中