O que mudou no HyperPod com Slurm
A AWS anunciou uma atualização relevante para quem trabalha com treinamento distribuído de modelos de IA: o Amazon SageMaker HyperPod agora suporta configuração de topologia de rede no nível de partição em clusters orquestrados pelo Slurm. Na prática, isso significa que um único cluster pode operar com topologias diferentes em partições distintas, cada uma otimizada para o tipo de instância que ela utiliza.
Topologia block e tree: cada partição com a sua
Antes dessa atualização, a configuração de topologia era aplicada de forma mais uniforme ao cluster. Agora, o HyperPod determina automaticamente qual topologia aplicar a cada partição com base nos tipos de instância que compõem seus grupos de computação:
- Partições com instâncias do tipo Amazon EC2 UltraServer — como
ml.p6e-gb200.36xlarge— utilizam topologia block. - Partições com instâncias de interconexão hierárquica — como
ml.p5.48xlarge,ml.p5e.48xlargeeml.p5en.48xlarge— utilizam topologia tree. - Partições com tipos de instância que não fornecem informações de topologia de rede permanecem totalmente agendáveis, sem restrições adicionais.
Por que isso importa para o treinamento distribuído
A escolha da topologia certa para cada tipo de instância tem impacto direto na eficiência da comunicação entre GPUs. Com o alinhamento correto entre o posicionamento dos jobs e as características de interconexão de cada instância, a AWS aponta ganhos em três frentes:
- Comunicação GPU a GPU mais rápida.
- Operações coletivas NCCL (Biblioteca de Comunicações Coletivas NVIDIA) mais eficientes.
- Maior throughput (vazão) geral no treinamento.
Manutenção automática da topologia
Um ponto importante dessa atualização é que o HyperPod mantém a configuração de topologia de forma automática ao longo do ciclo de vida do cluster. Isso inclui eventos de escalonamento para cima, escalonamento para baixo e substituição de nós — em todos esses casos, a topologia de cada partição é atualizada para refletir o estado atual do cluster, sem necessidade de intervenção manual.
Como começar a usar
Para aproveitar o recurso, basta criar ou atualizar um cluster SageMaker HyperPod com Slurm rodando a versão 25.11 ou superior, utilizando os tipos de instância GPU suportados. O agendamento com consciência de topologia (topology-aware scheduling) é habilitado por padrão e não exige nenhuma configuração adicional.
O recurso está disponível em todas as regiões AWS onde o Amazon SageMaker HyperPod é suportado. Para se aprofundar, a documentação oficial cobre os detalhes de implementação: Usando agendamento com consciência de topologia no Amazon SageMaker HyperPod.
Fonte
Amazon SageMaker HyperPod now supports partition-level topology for Slurm orchestrated clusters (https://aws.amazon.com/about-aws/whats-new/2026/07/hyperpod-partition-topology-slurm/)
Leave a Reply