O que foi anunciado
A AWS anunciou suporte aos modelos OpenAI GPT-5.6 Terra e Luna no Amazon Bedrock com inferência geográfica restrita à Índia. Isso significa que organizações com requisitos de processamento local de dados — como instituições financeiras, empresas de saúde e órgãos do setor público — podem usar esses modelos em escala sem que nenhum dado saia do território indiano.
Ambos os modelos oferecem uma janela de contexto de 1 milhão de tokens, aceitam entrada de texto e imagem, e produzem saída em texto. Com essa capacidade, uma única requisição pode processar documentos longos, bases de código extensas ou cargas de trabalho mistas com texto e imagem.
Como funciona a inferência geográfica na Índia
O Amazon Bedrock já oferece inferência entre regiões (cross-Region inference) como mecanismo de capacidade: em vez de ficar limitado à capacidade de uma única região, as requisições são distribuídas automaticamente por um pool maior de computação. Isso ajuda a manter a taxa de transferência e o desempenho consistente, especialmente em picos de tráfego.
No caso da Índia, o roteamento acontece exclusivamente entre as regiões Ásia-Pacífico (Mumbai) ap-south-1 e Ásia-Pacífico (Hyderabad) ap-south-2. Você pode fazer chamadas a partir de qualquer uma das duas regiões como origem, e o Bedrock decide qual região de destino atende a requisição com base na capacidade disponível.
Para consultar a disponibilidade atualizada por modelo e região, a AWS disponibiliza a documentação de disponibilidade regional por modelos no Guia do Usuário do Amazon Bedrock.
Perfis de inferência geográfica
A inferência entre regiões funciona por meio de perfis de inferência. Você passa o ID do perfil como parâmetro de modelo na chamada de API, e ele define tanto o modelo quanto as regiões para as quais o Bedrock pode rotear a requisição. Os dois perfis disponíveis para a Índia são:
in.openai.gpt-5.6-terra— para o GPT-5.6 Terrain.openai.gpt-5.6-luna— para o GPT-5.6 Luna
Com esses perfis, a cobrança e o consumo de cotas são contabilizados na conta da região de origem, independentemente de qual região de backend processou a requisição. Logs do Amazon CloudWatch e do AWS CloudTrail também são registrados apenas na região de origem, o que simplifica o monitoramento.
Endpoint recomendado: bedrock-runtime
Para novas aplicações, a AWS recomenda o uso do endpoint bedrock-runtime. Ele suporta as APIs nativas do Bedrock — InvokeModel e Converse — além das APIs compatíveis com OpenAI (Responses e Chat Completions) e a API Messages da Anthropic. É também nesse endpoint que recursos como Guardrails, roteamento inteligente de prompts e inferência entre regiões estão disponíveis.
Residência de dados e segurança
O perfil geográfico da Índia garante que a inferência permaneça dentro do país: as requisições só trafegam entre ap-south-1 e ap-south-2, com criptografia em trânsito pela rede da Amazon.
O Amazon Bedrock adota um modelo de segurança de dados com retenção zero (ZDR — Zero Data Retention): por padrão, entradas e saídas dos modelos não são armazenadas. No entanto, para determinados modelos, incluindo o GPT-5.6, conteúdo sinalizado pelos classificadores automáticos de detecção de abuso do Bedrock pode ser retido para análise offline. Para mais detalhes, consulte a documentação sobre detecção de abuso no Guia do Usuário do Amazon Bedrock.
Inferência global também disponível
Além dos perfis geográficos da Índia, o Bedrock oferece perfis de inferência global (prefixo global.) que roteiam requisições para regiões comerciais da AWS ao redor do mundo, maximizando a capacidade disponível. Esses perfis suportam os modelos GPT-5.6, incluindo Sol, Terra e Luna. Porém, se o seu workload tiver requisitos de processamento local de dados, use os perfis com prefixo in., que mantêm a inferência dentro da Índia. Para saber mais sobre inferência global, consulte o post Introdução à inferência entre regiões para modelos OpenAI GPT-5.6 no Amazon Bedrock.
Como chamar os modelos GPT-5.6
Via OpenAI Responses API
Os modelos GPT-5.6 no Amazon Bedrock suportam nativamente o formato da OpenAI Responses API. Se sua aplicação já utiliza o SDK da OpenAI, basta apontar o cliente para o endpoint do Bedrock em uma das regiões da Índia e passar o ID do perfil de inferência geográfica como parâmetro de modelo.
Para autenticação, o Bedrock aceita credenciais AWS padrão ou uma chave de API do Amazon Bedrock. Para produção, a recomendação é gerar chaves de curta duração programaticamente com o pacote aws-bedrock-token-generator. O exemplo abaixo usa o endpoint de Mumbai (ap-south-1) com o perfil geográfico do GPT-5.6 Terra:
from aws_bedrock_token_generator import provide_token
from openai import OpenAI
# Point the OpenAI SDK at the Amazon Bedrock OpenAI-compatible
# endpoint in the Asia Pacific (Mumbai) Region.
client = OpenAI(
base_url="https://bedrock-runtime.ap-south-1.amazonaws.com/openai/v1",
api_key=provide_token(region="ap-south-1"), # short-term Amazon Bedrock API key, valid up to 12 hours
)
# Geographic (India) inference profile ID for GPT-5.6 Terra.
model_id = "in.openai.gpt-5.6-terra" # "in.openai.gpt-5.6-luna" for luna
response = client.responses.create(
model=model_id,
input="Extract the payment due date and total amount from the invoice text that follows, and return them as JSON. <invoice text>",
max_output_tokens=512,
)
print(response.output_text)
Controlando a profundidade de raciocínio
Para controlar a profundidade de raciocínio, utilize o parâmetro opcional reasoning, por exemplo reasoning={"effort": "low"}. Os modelos GPT-5.6 no Bedrock suportam os seguintes níveis de esforço: none, low, medium, high, xhigh e max. Para mais informações, consulte o post Introdução aos modelos OpenAI GPT-5.6 Sol, Terra e Luna no Amazon Bedrock. Omitir o parâmetro usa o padrão do modelo.
response = client.responses.create(
model="in.openai.gpt-5.6-terra",
input="Extract the payment due date and total amount from the invoice text that follows, and return them as JSON. <invoice text>",
reasoning={"effort": "high"}, # none | low | medium | high | xhigh | max
max_output_tokens=512,
)
Para a lista completa de parâmetros suportados, consulte a documentação dos modelos OpenAI no Guia do Usuário do Amazon Bedrock.
Conversas multi-turno com estado no servidor
Defina store=True para que o Bedrock retenha a resposta no servidor. Em seguida, referencie-a no próximo turno com previous_response_id. Assim, você envia apenas o novo turno, sem precisar reenviar o histórico completo da conversa:
first = client.responses.create(
model="in.openai.gpt-5.6-terra",
input="Remember this: my favorite number is 42. Reply with just 'stored'..",
max_output_tokens=50,
store=True,
)
second = client.responses.create(
model="in.openai.gpt-5.6-terra",
previous_response_id=first.id, # the model recalls the earlier turn
input="what is my favourite number?",
max_output_tokens=50,
store=True,
)
print(second.output_text)
Importante: se você encadear com previous_response_id, a resposta referenciada deve ter sido criada com store=True. Encadear a partir de uma resposta não armazenada retorna erro.
Respostas em streaming
stream = client.responses.create(
model="in.openai.gpt-5.6-terra",
input="Draft a short status update for a delayed shipment, in a polite and direct tone.",
max_output_tokens=512,
stream=True,
)
for event in stream:
if event.type == "response.output_text.delta":
print(event.delta, end="")
Via Amazon Bedrock Converse API
Se você preferir o SDK da AWS com autenticação SigV4 em vez de uma chave de API, a Converse API do Amazon Bedrock também suporta os modelos GPT-5.6 com a mesma interface unificada disponível para outros modelos no Bedrock:
import boto3
# Standard AWS credentials (SigV4), no API key needed.
client = boto3.client("bedrock-runtime", region_name="ap-south-1")
model_id = "in.openai.gpt-5.6-terra" # India Geo inference profile
response = client.converse(
modelId=model_id,
messages=[
{
"role": "user",
"content": [{"text": "Classify this support ticket as billing, technical, or account: <ticket text>"}],
}
],
inferenceConfig={"maxTokens": 512},
)
print(response["output"]["message"]["content"]
Cache de prompts
Quando os prompts compartilham um prefixo longo e estável — como instruções de sistema, trechos de base de conhecimento ou exemplos de few-shot — os modelos GPT-5.6 no Bedrock suportam cache de prompts. Leituras em cache são cobradas com 90% de desconto em relação aos tokens de entrada não cacheados, o que representa economia significativa em workloads de Geração Aumentada por Recuperação (RAG — Retrieval Augmented Generation) e agentes que repetem o mesmo contexto em muitos turnos. Mais detalhes estão disponíveis na documentação de cache de prompts do Amazon Bedrock.
O cache de prompts funciona com os perfis de inferência geográfica da Índia, mantendo a economia dentro do limite de residência de dados do país. Ele opera em dois modos: implícito (o Bedrock define os pontos de cache automaticamente, com prefixo mínimo de 1.024 tokens) e explícito (você marca o limite de cache manualmente, e o prefixo cacheado permanece ativo por pelo menos 30 minutos).
response = client.responses.create(
model="in.openai.gpt-5.6-terra",
prompt_cache_key="ticket-agent-ver123", # same key across all requests
input=[
{
"type": "message",
"role": "developer",
"content": [{
"type": "input_text",
"text": SYSTEM_INSTRUCTIONS, # long, static: guidelines, KB excerpts (>= 1,024 tokens)
"prompt_cache_breakpoint": {"mode": "explicit"},
}],
},
{
"type": "message",
"role": "user",
"content": [{
"type": "input_text",
"text": user_question, # changes on every request
}],
},
],
extra_body={"prompt_cache_options": {"mode": "explicit"}},
)
Cada resposta informa o que o cache fez, em usage.input_tokens_details:
details = response.usage.input_tokens_details
print(f"cached: {details.cached_tokens}, written: {details.cache_write_tokens}")
Na primeira chamada, cache_write_tokens será preenchido à medida que o prefixo é armazenado. Nas chamadas seguintes, os mesmos tokens retornam como cached_tokens, cobrados à taxa de leitura de cache.
Permissões do IAM para inferência geográfica na Índia
Para permitir que uma função do Gerenciamento de Identidade e Acesso da AWS (IAM — Identity and Access Management) invoque os modelos GPT-5.6 pelo perfil de inferência geográfica da Índia, é necessário conceder acesso a três recursos: o próprio perfil de inferência geográfica, o modelo de fundação (FM — Foundation Model) na região de origem e o FM em cada região de destino listada no perfil (ap-south-1 e ap-south-2). Você pode usar a política gerenciada AmazonBedrockLimitedAccess ou criar a sua própria.
O exemplo abaixo concede permissão para usar o modelo GPT-5.6 Terra pelo perfil de inferência geográfica da Índia. A região de origem é ap-south-1 e as regiões de destino são ap-south-1 e ap-south-2. Substitua <ACCOUNT> pelo ID da sua conta e duplique os recursos para in.openai.gpt-5.6-luna se a função precisar de ambos os modelos. Se você originar de Hyderabad, use o ARN do perfil de inferência de ap-south-2 no primeiro statement:
{
"Version": "2012-10-17",
"Statement": [
{
"Sid": "GrantGeoCrisInferenceProfileAccess",
"Effect": "Allow",
"Action": [
"bedrock:InvokeModel*"
],
"Resource": [
"arn:aws:bedrock:ap-south-1:<ACCOUNT>:inference-profile/in.openai.gpt-5.6-terra",
"arn:aws:bedrock:ap-south-1:<ACCOUNT>:project/default"
]
},
{
"Sid": "GrantGeoCrisModelAccess",
"Effect": "Allow",
"Action": [
"bedrock:InvokeModel*"
],
"Resource": [
"arn:aws:bedrock:ap-south-1::foundation-model/openai.gpt-5.6-terra",
"arn:aws:bedrock:ap-south-2::foundation-model/openai.gpt-5.6-terra"
],
"Condition": {
"StringEquals": {
"bedrock:InferenceProfileArn": "arn:aws:bedrock:ap-south-1:<ACCOUNT>:inference-profile/in.openai.gpt-5.6-terra"
}
}
},
{
"Sid": "AllowBearerTokenAuth",
"Effect": "Allow",
"Action": ["bedrock:CallWithBearerToken"],
"Resource": "*"
}
]
}
Se sua organização usa Políticas de Controle de Serviço (SCP — Service Control Policies) para bloquear regiões não utilizadas, as condições específicas de região do SCP devem permitir todas as regiões de destino listadas no perfil de inferência geográfica. Para o perfil da Índia, tanto ap-south-1 quanto ap-south-2 devem estar liberadas. Bloquear qualquer região de destino fará a inferência entre regiões falhar, mesmo que a região de origem permaneça acessível.
Configurando o Codex com GPT-5.6 no Amazon Bedrock
O Codex pode usar os perfis de inferência geográfica via Amazon Bedrock Runtime. Para isso, instale a versão mais recente do Codex CLI (codex-cli 0.149.1 ou superior). Para organizações cujo provedor de identidade é Okta, Auth0, Microsoft Entra ID, Amazon Cognito ou AWS IAM Identity Center, o repositório AWS OIDC Auth Helper fornece um helper de credenciais de exemplo.
Após configurar o provedor de identidade e o perfil AWS correspondente, crie ou atualize o arquivo ~/.codex/config.toml referenciando o perfil AWS. Consulte a referência de configuração do Codex para outras configurações suportadas:
model = "in.openai.gpt-5.6-terra"
model_provider = "amazon-bedrock-runtime"
model_reasoning_effort = "high"
[model_providers.amazon-bedrock-runtime.aws]
profile = "<AWS_OIDC_PROFILE>"
region = "ap-south-1"
Para usar na região Ásia-Pacífico (Hyderabad), defina a região como ap-south-2 no perfil AWS e na configuração do Codex. Se você já tiver credenciais AWS configuradas localmente, o Codex pode usá-las diretamente — basta apontar o provedor Amazon Bedrock Runtime para um perfil AWS e uma região da Índia, definindo o modelo como um ID de perfil de inferência geográfica da Índia.
Monitoramento e logs
Os perfis de inferência geográfica da Índia funcionam com os mesmos controles de nível de conta já utilizados para outros modelos no Amazon Bedrock. As requisições aparecem no log de invocação de modelos do Amazon Bedrock da mesma forma que requisições sob demanda. Esses logs podem ser entregues ao Amazon Simple Storage Service (Amazon S3) ou ao Amazon CloudWatch Logs.
Métricas do CloudWatch para contagem de invocações, contagem de tokens, latência, throttles e erros são publicadas por perfil de inferência. Você pode acompanhar o uso dos modelos GPT-5.6 a partir de Mumbai ou Hyderabad sem precisar correlacionar logs entre regiões. Para verificar qual região de destino processou uma determinada requisição, os eventos do CloudTrail incluem um campo additionalEventData com a chave inferenceRegion — para o perfil da Índia, esse valor será sempre ap-south-1 ou ap-south-2, fornecendo um registro auditável de que a inferência permaneceu dentro da Índia.
Próximos passos
Para começar, revise os model cards do GPT-5.6 Terra e Luna e a seção de inferência entre regiões no Guia do Usuário do Amazon Bedrock. Experimente um prompt no playground do console do Amazon Bedrock em Mumbai ou Hyderabad e, em seguida, integre os exemplos de código apresentados neste artigo.
Antes de dimensionar um workload de produção, consulte a página de preços do Amazon Bedrock para verificar as tarifas atuais do GPT-5.6. Em caso de dúvidas ou para interagir com a comunidade, o AWS re:Post é um bom lugar para buscar respostas ou postar perguntas.
Fonte
Introducing OpenAI models on Amazon Bedrock for in-country inferencing in India (https://aws.amazon.com/blogs/machine-learning/introducing-openai-models-on-amazon-bedrock-for-in-country-inferencing-in-india/)
Leave a Reply