O que foi anunciado
A AWS anunciou uma expansão significativa no suporte do Amazon Bedrock aos modelos OpenAI. A partir desta atualização, os modelos GPT-5.6 — nas variantes Sol, Terra e Luna — passam a estar disponíveis no endpoint bedrock-runtime, com suporte às APIs Responses, Converse e Chat Completions. Além disso, a AWS introduz a Inferência entre Regiões (Cross-Region Inference) para esses modelos, trazendo mais flexibilidade operacional para quem utiliza IA generativa no Bedrock.
Como funciona a Inferência entre Regiões
A Inferência entre Regiões roteia automaticamente as requisições de inferência entre múltiplas regiões da AWS, sem que o time de engenharia precise gerenciar capacidade manualmente em cada região. O recurso é oferecido em duas modalidades:
- Geo Cross-Region Inference (Inferência Geo entre Regiões): roteia as requisições dentro de uma geografia predefinida, mantendo os dados processados naquela área geográfica. Esta modalidade inclui suporte ao novo US Geo (US CRIS), lançado junto com este anúncio.
- Global Cross-Region Inference (Inferência Global entre Regiões): roteia as requisições a partir de qualquer região comercial da AWS onde o modelo esteja disponível, oferecendo o maior acesso à capacidade do Bedrock e o maior throughput em momentos de pico de demanda. Essa modalidade também tem um custo por token menor do que a inferência regional ou Geo para os modelos OpenAI.
Expansão do suporte a APIs
Com esta atualização, os modelos GPT da OpenAI no Bedrock passam a ser compatíveis com três APIs diretamente no endpoint bedrock-runtime:
- Responses API
- Chat Completions API
- Converse API
Por rodarem nativamente no bedrock-runtime, esses modelos se beneficiam dos mesmos controles que já existem para outros modelos no Bedrock, sem necessidade de configurações adicionais.
Governança, observabilidade e custos
Um ponto relevante desta integração é que os modelos OpenAI no Bedrock passam a se comportar como qualquer outro modelo da plataforma do ponto de vista de governança e visibilidade financeira:
- O uso aparece no Bedrock model invocation logging, com entrega para o Amazon S3 ou Amazon CloudWatch Logs.
- As métricas do Amazon CloudWatch cobrem contagem de invocações, contagem de tokens, latência, throttles e erros.
- Os custos são detalhados no AWS Cost Explorer e no AWS Cost and Usage Report (CUR), permitindo atribuir gastos por modelo.
Disponibilidade
A Inferência entre Regiões para modelos OpenAI está disponível em todas as regiões da AWS onde os modelos OpenAI no Amazon Bedrock já são oferecidos. Para começar, a AWS recomenda consultar os cartões de modelo para o GPT-5.6 (Sol, Terra e Luna) no Guia do Usuário do Amazon Bedrock.
Fonte
Amazon Bedrock expands API support and introduces Cross Region Inferencing for OpenAI models (https://aws.amazon.com/about-aws/whats-new/2026/08/amazon-bedrock-cross-region-openai-v2/)
Leave a Reply