O que foi anunciado
A AWS anunciou que o Amazon SageMaker HyperPod passou a oferecer suporte a verificações profundas de saúde (deep health checks) em clusters orquestrados pelo Slurm quando criados com provisionamento contínuo. Com isso, equipes de machine learning podem verificar proativamente a saúde dos aceleradores GPU em instâncias em execução a qualquer momento — sem precisar esperar uma falha acontecer para descobrir que um nó está comprometido.
Contexto: o que é provisionamento contínuo no HyperPod
O provisionamento contínuo permite iniciar treinamentos rapidamente e escalar grupos de instâncias de forma assíncrona, sem o modelo “tudo ou nada” — ou seja, a ausência de uma instância não bloqueia o início do job. À medida que a capacidade vai ficando disponível, novos nós são adicionados ao cluster Slurm de forma independente.
Esse modelo traz agilidade, mas também um desafio: como garantir que cada nó adicionado está saudável antes de receber cargas de trabalho?
O problema que a novidade resolve
Mesmo um único nó com hardware defeituoso pode desperdiçar horas de tempo computacional e atrasar workloads críticos. Antes dessa atualização, não havia uma forma integrada de validar a saúde do hardware em nós adicionados de forma assíncrona sem interromper o que já estava rodando.
Como funcionam as verificações profundas de saúde
Com o recurso agora disponível, é possível direcionar as verificações para grupos de instâncias inteiros ou para instâncias específicas, executando testes abrangentes de estresse de hardware e testes de conectividade antes de comprometer recursos computacionais a um job.
O fluxo funciona da seguinte forma:
- À medida que novos nós são adicionados ao cluster pelo provisionamento contínuo, as verificações profundas de saúde podem ser executadas em cada nó assim que ele fica online.
- O hardware é validado antes de qualquer job ser agendado naquele nó.
- Workloads já em execução nos nós saudáveis não são interrompidos durante esse processo.
- Instâncias em processo de verificação são automaticamente isoladas do agendamento de jobs e retornam ao serviço assim que passam nos testes.
Visibilidade e recuperação automática
O progresso e os resultados das verificações ficam visíveis tanto no nível do grupo de instâncias quanto no nível de instância individual — acessíveis pelo console do SageMaker e pelas APIs. Isso oferece visibilidade completa sobre saúde da GPU, conectividade de rede e desempenho de comunicação entre múltiplos nós.
Quando combinado com o recurso de recuperação automática de nós do HyperPod, instâncias que falham nas verificações são automaticamente reiniciadas ou substituídas, mantendo a saúde geral do cluster sem intervenção manual.
Disponibilidade
O recurso está disponível em todas as regiões onde o Amazon SageMaker HyperPod já opera. Para saber mais sobre as verificações profundas de saúde sob demanda e o provisionamento contínuo, consulte o Guia do Usuário do Amazon SageMaker HyperPod.
Fonte
Amazon SageMaker HyperPod now supports deep health checks for Slurm clusters with continuous provisioning (https://aws.amazon.com/about-aws/whats-new/2026/07/deep-health-check-continuous-slurm/)
Leave a Reply