SageMaker HyperPod adds MinCount for Slurm clusters
Amazon SageMaker HyperPod now allows users to specify minimum capacity requirements (MinCount) for Slurm-orchestrated clusters using continuous provisioning. This enhancement ensures distributed AI/ML training jobs start with a guaranteed number of nodes, preventing issues with partial cluster capacity. This feature is available in all AWS Regions where SageMaker HyperPod is supported and is particularly beneficial for large-scale distributed training.
- →Specify minimum capacity for Slurm clusters
- →Improved control for distributed training workloads
- →Automatic rollback if minimum capacity not met
Features (1) ›
- Specify minimum capacity for Slurm clusters
Amazon SageMaker HyperPod now supports the MinCount parameter for Slurm clusters with continuous provisioning. This allows users to define a minimum number of instances that must be available before a cluster group is considered 'InService', ensuring distributed training jobs start with sufficient resources.
Enhancements (1) ›
- Improved control for distributed training workloads
The MinCount feature is particularly useful for distributed training frameworks like PyTorch FSDP, Megatron-LM, and NVIDIA NeMo, which often require a fixed number of nodes to start efficiently. It also helps teams guarantee a baseline GPU count for SLAs or cost-efficiency.
Notes (1) ›
- Automatic rollback if minimum capacity not met
If the specified minimum instance count cannot be provisioned within 3 hours, SageMaker HyperPod will automatically roll back the instance group to its last known good state, preventing prolonged cluster creation failures.
https://aws.amazon.com/about-aws/whats-new/2026/05/amazon-sagemaker-hyperpod-mincount/
Related releases
- SageMaker Unified Studio Enhances Git Version Control Across Project Tools AWS What's New ·
- AWS Glue Data Quality Adds Distribution Statistics for Data Profiling AWS What's New ·
- SageMaker Inference Adds NVIDIA G7 Instances for Faster LLM Deployment AWS What's New ·
- Amazon SageMaker AI inference adds G6 instances in AWS GovCloud AWS What's New ·
- Amazon SageMaker G7e instances expand to Seoul, London, and Tokyo AWS What's New ·
- SageMaker Studio Integrates with Amazon OpenSearch for Unified Data Analysis AWS What's New ·