O que mudou
A Amazon anunciou que os modelos GPT-5.6 da OpenAI — nas versões Terra e Luna — agora estão disponíveis no Amazon Bedrock com inferência geográfica dentro da Índia. Para empresas com exigência de processamento local, em setores como serviços financeiros, saúde e setor público, isso significa usar modelos da OpenAI em escala sem que os dados saiam do país.
Os dois modelos oferecem janela de contexto de 1 milhão de tokens, aceitam entrada de texto e imagem e produzem saída de texto. Aplicações podem processar documentos longos, bases de código extensas e cargas mistas de texto e imagem em uma única requisição.
Como funciona a residência de dados
A inferência geográfica da Índia roteia requisições apenas entre as regiões Ásia-Pacífico (Mumbai, ap-south-1) e (Hyderabad, ap-south-2). São dois perfis de inferência: in.openai.gpt-5.6-terra e in.openai.gpt-5.6-luna. O processamento nunca deixa o país.
O Bedrock usa um modelo de zero retenção de dados (ZDR): por padrão, entradas e saídas não são armazenadas. A exceção é o conteúdo sinalizado pelos classificadores automáticos de abuso, retido para detecção offline. O dado é criptografado em trânsito na rede da Amazon.
Três formas de chamar os modelos
Os modelos aceitam o formato da OpenAI Responses API, do Chat Completions e também o Converse API nativo do Bedrock. Para quem já usa o SDK da OpenAI, basta apontar o cliente para o endpoint do Bedrock e usar o ID do perfil como nome do modelo, autenticando com credenciais AWS ou uma chave temporária do Bedrock.
Há suporte a níveis de esforço de raciocínio (none, low, medium, high, xhigh e max), conversas multi-turno com estado no servidor e streaming de respostas.
Prompt caching com 90% de desconto
Para cargas de RAG e agentes que repetem o mesmo contexto a cada turno, o prompt caching reduz em 90% o custo de tokens de entrada já em cache. O recurso funciona com os perfis da Índia, mantendo a economia dentro da fronteira de residência de dados. O cache pode ser explícito ou implícito, com prefixo mínimo de 1.024 tokens, e cada resposta informa quantos tokens vieram do cache.
Descubra mais sobre noticiAI
Assine para receber nossas notícias mais recentes por e-mail.



