aws AWS What's New ·

SageMaker HyperPod adds MinCount for Slurm clusters

aiawsengineeraws-sagemaker
feature

Amazon SageMaker HyperPod now allows users to specify minimum capacity requirements (MinCount) for Slurm-orchestrated clusters using continuous provisioning. This enhancement ensures distributed AI/ML training jobs start with a guaranteed number of nodes, preventing issues with partial cluster capacity. This feature is available in all AWS Regions where SageMaker HyperPod is supported and is particularly beneficial for large-scale distributed training.

  • Specify minimum capacity for Slurm clusters
  • Improved control for distributed training workloads
  • Automatic rollback if minimum capacity not met
Features (1)
  • Specify minimum capacity for Slurm clusters

    Amazon SageMaker HyperPod now supports the MinCount parameter for Slurm clusters with continuous provisioning. This allows users to define a minimum number of instances that must be available before a cluster group is considered 'InService', ensuring distributed training jobs start with sufficient resources.

Enhancements (1)
  • Improved control for distributed training workloads

    The MinCount feature is particularly useful for distributed training frameworks like PyTorch FSDP, Megatron-LM, and NVIDIA NeMo, which often require a fixed number of nodes to start efficiently. It also helps teams guarantee a baseline GPU count for SLAs or cost-efficiency.

Notes (1)
  • Automatic rollback if minimum capacity not met

    If the specified minimum instance count cannot be provisioned within 3 hours, SageMaker HyperPod will automatically roll back the instance group to its last known good state, preventing prolonged cluster creation failures.

Read the original announcement →

https://aws.amazon.com/about-aws/whats-new/2026/05/amazon-sagemaker-hyperpod-mincount/

Related releases