Inteligência artificial, sem ruído.
OpenAI3 min

AWS lança cache explícito de prompts para GPT-5.6 com 90% de desconto

Prompt caching explícito no Amazon Bedrock reduz custo em 90% para tokens repetidos em workflows agentic, com controle granular sobre o que é cacheado.

AWS lança cache explícito de prompts para GPT-5.6 com 90% de desconto

O que mudou

A AWS anunciou nesta quarta-feira (30) o prompt caching explícito para os modelos GPT-5.6 no Amazon Bedrock. O novo recurso dá controle preciso sobre quais partes do prompt são armazenadas em cache e reutilizadas entre requisições, com 90% de desconto nos tokens cacheados — a economia é drástica para fluxos que repetem instruções longas.

O cache permanece ativo por 30 minutos e é especialmente útil em workflows agentic, onde instruções de sistema, definições de ferramentas e documentos de referência se repetem a cada chamada. Em vez de pagar o preço cheio por cada token desses em toda requisição, você paga apenas 10%.

Os três modelos GPT-5.6 no Bedrock

A família GPT-5.6 está disponível em três tiers de capacidade:

  • GPT-5.6 Sol: raciocínio complexo e codificação agentic. Disponível em US East (N. Virginia e Ohio).
  • GPT-5.6 Terra:平衡 para cargas de produção do dia a dia. Disponível também em US West (Oregon).
  • GPT-5.6 Luna: tarefas rápidas e de alto volume como classificação e sumarização. Também em Oregon.

Todos os modelos usam a API Responses compatível com OpenAI através do endpoint bedrock-mantle. A precificação é pay-per-token e o uso conta para compromissos AWS existentes.

Cache explícito vs. implícito

A grande novidade aqui é o controle. O cache implícito (já existente) decide automaticamente o que armazenar. O cache explícito permite que você marque blocos específicos do prompt — por exemplo, toda a seção de instruções do sistema — garantindo que aquele conteúdo seja cacheado sem ambiguidade. Isso é particularmente relevante para:

  • Sistemas de agentes com dezenas de ferramentas definidas
  • Chatbots com instruções longas de persona e compliance
  • Pipelines RAG que reutilizam documentos de contexto
  • Aplicações multi-turno com histórico de conversa extenso

Controle de esforço de raciocínio

O GPT-5.6 introduz níveis de raciocínio configuráveis: none, low, medium (padrão), high e xhigh. Para tarefas simples, usar none reduz latência. Para problemas complexos, xhigh aloca mais capacidade de raciocínio. Essa granularidade permite otimizar custo e velocidade conforme a demanda real de cada requisição.

Migração para o Bedrock

A AWS fornece um token generator (aws-bedrock-token-generator) que gera credenciais temporárias a partir de roles IAM, eliminando a necessidade de chaves de longa duração. O setup é mínimo:

pip install openai aws-bedrock-token-generator

E o código de chamada é essencialmente o mesmo da API da OpenAI, trocando apenas a base_url e o método de autenticação. Para times que já usam GPT-5.6 fora da AWS, a migração é direta. Para quem está em modelos anteriores (GPT-4, GPT-4.5), o ganho com prompt caching explícito é um argumento forte para upgrade.

Por que isso importa

O custo de prompts repetidos é um gargalo silencioso em aplicações de IA em produção. Com 90% de desconto em tokens cacheados, o prompt caching explícito transforma a economia de fluxos agentic — onde um único agente pode fazer dezenas de chamadas com as mesmas instruções de sistema. Para o mercado brasileiro, onde cada centavo de custo de API é multiplicado pelo câmbio, essa otimização é especialmente relevante.



Descubra mais sobre noticiAI

Assine para receber nossas notícias mais recentes por e-mail.

R
Sobre o autorRedação Noticiai

Equipe editorial dedicada a explicar inteligência artificial com clareza, independência e contexto.