Amazon SageMaker HyperPod passa a suportar prefill e decode desagregados

O que mudou no SageMaker HyperPod

A AWS anunciou suporte a Prefill e Decode Desagregados (DPD) no Amazon SageMaker HyperPod. A novidade é uma otimização de inferência que separa as duas fases do processamento de grandes modelos de linguagem (LLMs) em pools de GPUs dedicados, transferindo o cache de chave-valor (KV) entre eles via Elastic Fabric Adapter (EFA) com tecnologia GPU-Direct RDMA.

Por que isso importa na prática

Quem roda LLMs em produção para assistentes de chat, pipelines agênticos, geração aumentada por recuperação (RAG) e análise de documentos longos sabe bem o problema: manter latência por token consistente e throughput previsível sob tráfego misto é um desafio constante.

O gargalo clássico acontece quando as fases de prefill e decode compartilham a mesma GPU. Nesse cenário, uma única requisição com contexto longo pode travar a geração de tokens para todas as outras requisições simultâneas — forçando times de infraestrutura a superprovisionarem uma das fases só para proteger a outra. É desperdício de recurso e de dinheiro.

Como o DPD resolve o problema

Com o DPD, a AWS separa os dois workloads de forma inteligente:

  • O prefill, que é intensivo em computação, roda em um conjunto dedicado de GPUs.
  • O decode, que é limitado pela largura de banda de memória, roda em outro conjunto separado.

Dessa forma, as duas fases deixam de disputar os mesmos recursos. O resultado prático é latência por token mais consistente sob alta concorrência, maior goodput dentro de SLOs rígidos de latência, e a capacidade de escalar prefill e decode de forma independente — de acordo com a distribuição real de entrada e saída do workload.

Um roteador inteligente cuida do direcionamento automático: requisições de contexto longo seguem pelo caminho desagregado, enquanto prompts mais curtos vão direto para o decoder. Assim, o overhead de transferência só é pago quando realmente faz sentido.

Como habilitar o DPD

A ativação é feita adicionando uma seção pdSpec ao mesmo recurso customizado InferenceEndpointConfig já utilizado nos endpoints de inferência do HyperPod Inference Operator. O DPD também é compatível com os recursos existentes de offloading de cache KV e roteamento inteligente do HyperPod.

Disponibilidade

O DPD está disponível para clusters do SageMaker HyperPod que utilizam o orquestrador EKS em tipos de instância com suporte a EFA, em todas as regiões da AWS onde o Amazon SageMaker HyperPod já está disponível.

Para se aprofundar, a documentação oficial da AWS traz todos os detalhes em Prefill e Decode Desagregados para inferência no HyperPod, no Amazon SageMaker AI Developer Guide.

Fonte

Amazon SageMaker HyperPod now supports disaggregated prefill and decode (https://aws.amazon.com/about-aws/whats-new/2026/7/amazon-sagemaker-hyperpod-dpd/)

Comments

Leave a Reply

Your email address will not be published. Required fields are marked *