A Amazon Web Services ampliou o acesso aos modelos da OpenAI dentro do Amazon Bedrock: os modelos GPT-5.6 Sol, Terra e Luna agora podem ser acionados com inferência global cross-Region a partir das regiões de Sydney e Melbourne, na Austrália. O anúncio interessa diretamente a desenvolvedores brasileiros que operam cargas de trabalho na nuvem da AWS e querem combinar os modelos da OpenAI com a infraestrutura e a governança do Bedrock.
O que muda na prática
Com a inferência cross-Region, a aplicação chama o endpoint do Amazon Bedrock Runtime em Sydney ou Melbourne, e o serviço roteia a requisição para uma região comercial suportada. Isso dá acesso a um pool de capacidade mais amplo, sem que o time precise gerenciar o roteamento entre regiões. Os três modelos aceitam texto e imagem como entrada, geram texto e suportam janelas de contexto de até 1 milhão de tokens.
Cada modelo ocupa uma posição clara: o Sol é voltado a cargas exigentes de raciocínio, código e agentes; o Terra equilibra desempenho e custo para produção do dia a dia; e o Luna oferece inferência rápida e barata para aplicações de alto volume e sensíveis à latência.
Três formas de acesso e cache de prompt
Os modelos podem ser invocados pelo endpoint do Bedrock Runtime por três caminhos: a Responses API e a Chat Completions API da OpenAI (compatíveis, chamadas nos caminhos /openai/v1) e a Converse API nativa do Bedrock, usada com AWS SDKs como o Boto3. A autenticação aceita AWS Signature V4 ou uma chave de inferência temporária do Bedrock, eliminando a necessidade de armazenar uma chave estática.
O prompt caching do GPT-5.6 também está disponível, com dois modos: o implícito, ativado por padrão sem mudanças de código, e o explícito, em que o desenvolvedor define o prefixo reutilizável, o limite de cache e a chave. Para workloads com prompts longos e repetidos, isso pode reduzir sensivelmente o custo de inferência.
Codex, quotas e observabilidade
O OpenAI Codex também pode usar os mesmos perfis de inferência global por meio do Amazon Bedrock Runtime, com autenticação via OIDC para organizações que usam Okta, Auth0, Microsoft Entra ID, Amazon Cognito ou AWS IAM Identity Center. As quotas sob demanda são medidas em requisições por minuto e tokens por minuto — e a AWS recomenda solicitar aumentos com antecedência antes de levar para produção.
Para monitoramento, as requisições aparecem no logging de invocação de modelos, e o Codex exporta telemetria via OpenTelemetry para o CloudWatch Coding Agent Insights, que reúne uso de tokens, requisições de API, usuários ativos e taxa de acerto de cache em um painel único.
Descubra mais sobre noticiAI
Assine para receber nossas notícias mais recentes por e-mail.



