Amazon SageMaker HyperPod amplia suporte ao Ray com observabilidade, resiliência e inferência acelerada

O que mudou no HyperPod com Ray

A AWS anunciou melhorias no suporte ao Ray dentro do Amazon SageMaker HyperPod. Para quem não conhece, o Ray é um framework open-source bastante popular para escalar cargas de trabalho de Inteligência Artificial (IA) em uma camada de computação unificada — cobrindo desde processamento de dados e treinamento distribuído até aprendizado por reforço e serviço de modelos.

O problema que a AWS endereça com essa atualização é real: rodar Ray em Kubernetes em escala de produção costuma ser trabalhoso. Travamentos de jobs, baixa utilização de GPU por conta de alocações estáticas por equipe, configuração de observabilidade em múltiplas etapas e a ausência de um ambiente de desenvolvimento interativo são dores conhecidas de quem opera esse tipo de workload. Cada mudança de código exigia um novo envio de job e familiaridade com kubectl.

As três frentes de melhoria

Desenvolvimento mais ágil

Com a atualização, cientistas de dados podem criar, editar, monitorar e excluir clusters Ray diretamente por uma interface web no Amazon SageMaker Studio. É possível conectar o JupyterLab, o Code Editor ou até uma IDE local a um cluster Ray em execução e iterar de forma interativa com a escala do cluster disponível. O comportamento de um cluster Ray com múltiplos nós passa a se parecer com um ambiente de desenvolvimento local — cada mudança pode ser testada imediatamente, sem esperar um novo job entrar na fila.

Observabilidade integrada

O HyperPod agora provisiona dashboards no Grafana com métricas armazenadas no Amazon Managed Service for Prometheus, além de oferecer acesso com um clique ao Ray Dashboard por meio de um link seguro no navegador. Isso garante visibilidade sobre os workloads desde a primeira execução, sem configurações manuais complexas.

Treinamento resiliente em escala

Para treinar modelos em larga escala, o HyperPod traz recuperação automática de nós e detecção de jobs travados, lidando com falhas de GPU, travamentos, picos de perda e degradação de throughput. O checkpointing em camadas restaura o estado a partir da memória do cluster para maximizar o goodput, e a governança de tarefas melhora a utilização de computação por meio de cotas, prioridades e preempção. Juntos, esses mecanismos mantêm as execuções longas de treinamento progredindo mesmo diante de falhas.

Inferência acelerada com Ray Serve

Para inferência usando o Ray Serve, um cache de chave-valor (KV cache) em camadas reutiliza prefixos em cache para reduzir o tempo até o primeiro token. Também é possível fazer o deploy de modelos do Amazon SageMaker JumpStart diretamente. O código Ray open-source roda sem alterações, e as equipes podem adotar a experiência integrada no SageMaker Studio ou incorporar capacidades individuais em sua própria plataforma de Machine Learning (ML).

Disponibilidade

O suporte ao Ray está disponível para clusters HyperPod orquestrados pelo Amazon Elastic Kubernetes Service (EKS), nas regiões AWS onde o SageMaker HyperPod é suportado. Para se aprofundar, a AWS disponibiliza a documentação do SageMaker HyperPod e um demo interativo para explorar as novidades na prática.

Fonte

Amazon SageMaker HyperPod enhances support for Ray (https://aws.amazon.com/about-aws/whats-new/2026/08/amazon-sagemaker-hyperpod-ray)

Comments

Leave a Reply

Your email address will not be published. Required fields are marked *