Amazon Bedrock amplia suporte a APIs e lança Inferência entre Regiões para modelos OpenAI

O que foi anunciado

A AWS anunciou uma expansão significativa no suporte do Amazon Bedrock aos modelos OpenAI. A partir desta atualização, os modelos GPT-5.6 — nas variantes Sol, Terra e Luna — passam a estar disponíveis no endpoint bedrock-runtime, com suporte às APIs Responses, Converse e Chat Completions. Além disso, a AWS introduz a Inferência entre Regiões (Cross-Region Inference) para esses modelos, trazendo mais flexibilidade operacional para quem utiliza IA generativa no Bedrock.

Como funciona a Inferência entre Regiões

A Inferência entre Regiões roteia automaticamente as requisições de inferência entre múltiplas regiões da AWS, sem que o time de engenharia precise gerenciar capacidade manualmente em cada região. O recurso é oferecido em duas modalidades:

  • Geo Cross-Region Inference (Inferência Geo entre Regiões): roteia as requisições dentro de uma geografia predefinida, mantendo os dados processados naquela área geográfica. Esta modalidade inclui suporte ao novo US Geo (US CRIS), lançado junto com este anúncio.
  • Global Cross-Region Inference (Inferência Global entre Regiões): roteia as requisições a partir de qualquer região comercial da AWS onde o modelo esteja disponível, oferecendo o maior acesso à capacidade do Bedrock e o maior throughput em momentos de pico de demanda. Essa modalidade também tem um custo por token menor do que a inferência regional ou Geo para os modelos OpenAI.

Expansão do suporte a APIs

Com esta atualização, os modelos GPT da OpenAI no Bedrock passam a ser compatíveis com três APIs diretamente no endpoint bedrock-runtime:

  • Responses API
  • Chat Completions API
  • Converse API

Por rodarem nativamente no bedrock-runtime, esses modelos se beneficiam dos mesmos controles que já existem para outros modelos no Bedrock, sem necessidade de configurações adicionais.

Governança, observabilidade e custos

Um ponto relevante desta integração é que os modelos OpenAI no Bedrock passam a se comportar como qualquer outro modelo da plataforma do ponto de vista de governança e visibilidade financeira:

  • O uso aparece no Bedrock model invocation logging, com entrega para o Amazon S3 ou Amazon CloudWatch Logs.
  • As métricas do Amazon CloudWatch cobrem contagem de invocações, contagem de tokens, latência, throttles e erros.
  • Os custos são detalhados no AWS Cost Explorer e no AWS Cost and Usage Report (CUR), permitindo atribuir gastos por modelo.

Disponibilidade

A Inferência entre Regiões para modelos OpenAI está disponível em todas as regiões da AWS onde os modelos OpenAI no Amazon Bedrock já são oferecidos. Para começar, a AWS recomenda consultar os cartões de modelo para o GPT-5.6 (Sol, Terra e Luna) no Guia do Usuário do Amazon Bedrock.

Fonte

Amazon Bedrock expands API support and introduces Cross Region Inferencing for OpenAI models (https://aws.amazon.com/about-aws/whats-new/2026/08/amazon-bedrock-cross-region-openai-v2/)

Comments

Leave a Reply

Your email address will not be published. Required fields are marked *