O que mudou no SageMaker HyperPod
A AWS anunciou suporte a Prefill e Decode Desagregados (DPD) no Amazon SageMaker HyperPod. A novidade é uma otimização de inferência que separa as duas fases do processamento de grandes modelos de linguagem (LLMs) em pools de GPUs dedicados, transferindo o cache de chave-valor (KV) entre eles via Elastic Fabric Adapter (EFA) com tecnologia GPU-Direct RDMA.
Por que isso importa na prática
Quem roda LLMs em produção para assistentes de chat, pipelines agênticos, geração aumentada por recuperação (RAG) e análise de documentos longos sabe bem o problema: manter latência por token consistente e throughput previsível sob tráfego misto é um desafio constante.
O gargalo clássico acontece quando as fases de prefill e decode compartilham a mesma GPU. Nesse cenário, uma única requisição com contexto longo pode travar a geração de tokens para todas as outras requisições simultâneas — forçando times de infraestrutura a superprovisionarem uma das fases só para proteger a outra. É desperdício de recurso e de dinheiro.
Como o DPD resolve o problema
Com o DPD, a AWS separa os dois workloads de forma inteligente:
- O prefill, que é intensivo em computação, roda em um conjunto dedicado de GPUs.
- O decode, que é limitado pela largura de banda de memória, roda em outro conjunto separado.
Dessa forma, as duas fases deixam de disputar os mesmos recursos. O resultado prático é latência por token mais consistente sob alta concorrência, maior goodput dentro de SLOs rígidos de latência, e a capacidade de escalar prefill e decode de forma independente — de acordo com a distribuição real de entrada e saída do workload.
Um roteador inteligente cuida do direcionamento automático: requisições de contexto longo seguem pelo caminho desagregado, enquanto prompts mais curtos vão direto para o decoder. Assim, o overhead de transferência só é pago quando realmente faz sentido.
Como habilitar o DPD
A ativação é feita adicionando uma seção pdSpec ao mesmo recurso customizado InferenceEndpointConfig já utilizado nos endpoints de inferência do HyperPod Inference Operator. O DPD também é compatível com os recursos existentes de offloading de cache KV e roteamento inteligente do HyperPod.
Disponibilidade
O DPD está disponível para clusters do SageMaker HyperPod que utilizam o orquestrador EKS em tipos de instância com suporte a EFA, em todas as regiões da AWS onde o Amazon SageMaker HyperPod já está disponível.
Para se aprofundar, a documentação oficial da AWS traz todos os detalhes em Prefill e Decode Desagregados para inferência no HyperPod, no Amazon SageMaker AI Developer Guide.
Fonte
Amazon SageMaker HyperPod now supports disaggregated prefill and decode (https://aws.amazon.com/about-aws/whats-new/2026/7/amazon-sagemaker-hyperpod-dpd/)
Leave a Reply