Inteligência artificial, sem ruído.
Infraestrutura2 min

OpenAI GPT-5.6 chega ao Amazon Bedrock com inferência localizada na Índia

Modelos Terra e Luna, com contexto de 1 milhão de tokens, agora rodam dentro da Índia com residência de dados entre Mumbai e Hyderabad.

OpenAI GPT-5.6 chega ao Amazon Bedrock com inferência localizada na Índia

O que mudou

A Amazon anunciou que os modelos GPT-5.6 da OpenAI — nas versões Terra e Luna — agora estão disponíveis no Amazon Bedrock com inferência geográfica dentro da Índia. Para empresas com exigência de processamento local, em setores como serviços financeiros, saúde e setor público, isso significa usar modelos da OpenAI em escala sem que os dados saiam do país.

Os dois modelos oferecem janela de contexto de 1 milhão de tokens, aceitam entrada de texto e imagem e produzem saída de texto. Aplicações podem processar documentos longos, bases de código extensas e cargas mistas de texto e imagem em uma única requisição.

Como funciona a residência de dados

A inferência geográfica da Índia roteia requisições apenas entre as regiões Ásia-Pacífico (Mumbai, ap-south-1) e (Hyderabad, ap-south-2). São dois perfis de inferência: in.openai.gpt-5.6-terra e in.openai.gpt-5.6-luna. O processamento nunca deixa o país.

O Bedrock usa um modelo de zero retenção de dados (ZDR): por padrão, entradas e saídas não são armazenadas. A exceção é o conteúdo sinalizado pelos classificadores automáticos de abuso, retido para detecção offline. O dado é criptografado em trânsito na rede da Amazon.

Três formas de chamar os modelos

Os modelos aceitam o formato da OpenAI Responses API, do Chat Completions e também o Converse API nativo do Bedrock. Para quem já usa o SDK da OpenAI, basta apontar o cliente para o endpoint do Bedrock e usar o ID do perfil como nome do modelo, autenticando com credenciais AWS ou uma chave temporária do Bedrock.

Há suporte a níveis de esforço de raciocínio (none, low, medium, high, xhigh e max), conversas multi-turno com estado no servidor e streaming de respostas.

Prompt caching com 90% de desconto

Para cargas de RAG e agentes que repetem o mesmo contexto a cada turno, o prompt caching reduz em 90% o custo de tokens de entrada já em cache. O recurso funciona com os perfis da Índia, mantendo a economia dentro da fronteira de residência de dados. O cache pode ser explícito ou implícito, com prefixo mínimo de 1.024 tokens, e cada resposta informa quantos tokens vieram do cache.



Descubra mais sobre noticiAI

Assine para receber nossas notícias mais recentes por e-mail.

R
Sobre o autorRedação Noticiai

Equipe editorial dedicada a explicar inteligência artificial com clareza, independência e contexto.