Amazon SageMaker HyperPod agora suporta verificações profundas de saúde em clusters Slurm com provisionamento contínuo

O que foi anunciado

A AWS anunciou que o Amazon SageMaker HyperPod passou a oferecer suporte a verificações profundas de saúde (deep health checks) em clusters orquestrados pelo Slurm quando criados com provisionamento contínuo. Com isso, equipes de machine learning podem verificar proativamente a saúde dos aceleradores GPU em instâncias em execução a qualquer momento — sem precisar esperar uma falha acontecer para descobrir que um nó está comprometido.

Contexto: o que é provisionamento contínuo no HyperPod

O provisionamento contínuo permite iniciar treinamentos rapidamente e escalar grupos de instâncias de forma assíncrona, sem o modelo “tudo ou nada” — ou seja, a ausência de uma instância não bloqueia o início do job. À medida que a capacidade vai ficando disponível, novos nós são adicionados ao cluster Slurm de forma independente.

Esse modelo traz agilidade, mas também um desafio: como garantir que cada nó adicionado está saudável antes de receber cargas de trabalho?

O problema que a novidade resolve

Mesmo um único nó com hardware defeituoso pode desperdiçar horas de tempo computacional e atrasar workloads críticos. Antes dessa atualização, não havia uma forma integrada de validar a saúde do hardware em nós adicionados de forma assíncrona sem interromper o que já estava rodando.

Como funcionam as verificações profundas de saúde

Com o recurso agora disponível, é possível direcionar as verificações para grupos de instâncias inteiros ou para instâncias específicas, executando testes abrangentes de estresse de hardware e testes de conectividade antes de comprometer recursos computacionais a um job.

O fluxo funciona da seguinte forma:

  • À medida que novos nós são adicionados ao cluster pelo provisionamento contínuo, as verificações profundas de saúde podem ser executadas em cada nó assim que ele fica online.
  • O hardware é validado antes de qualquer job ser agendado naquele nó.
  • Workloads já em execução nos nós saudáveis não são interrompidos durante esse processo.
  • Instâncias em processo de verificação são automaticamente isoladas do agendamento de jobs e retornam ao serviço assim que passam nos testes.

Visibilidade e recuperação automática

O progresso e os resultados das verificações ficam visíveis tanto no nível do grupo de instâncias quanto no nível de instância individual — acessíveis pelo console do SageMaker e pelas APIs. Isso oferece visibilidade completa sobre saúde da GPU, conectividade de rede e desempenho de comunicação entre múltiplos nós.

Quando combinado com o recurso de recuperação automática de nós do HyperPod, instâncias que falham nas verificações são automaticamente reiniciadas ou substituídas, mantendo a saúde geral do cluster sem intervenção manual.

Disponibilidade

O recurso está disponível em todas as regiões onde o Amazon SageMaker HyperPod já opera. Para saber mais sobre as verificações profundas de saúde sob demanda e o provisionamento contínuo, consulte o Guia do Usuário do Amazon SageMaker HyperPod.

Fonte

Amazon SageMaker HyperPod now supports deep health checks for Slurm clusters with continuous provisioning (https://aws.amazon.com/about-aws/whats-new/2026/07/deep-health-check-continuous-slurm/)

Comments

Leave a Reply

Your email address will not be published. Required fields are marked *