O que mudou
A AWS anunciou nesta quarta-feira (30) o prompt caching explícito para os modelos GPT-5.6 no Amazon Bedrock. O novo recurso dá controle preciso sobre quais partes do prompt são armazenadas em cache e reutilizadas entre requisições, com 90% de desconto nos tokens cacheados — a economia é drástica para fluxos que repetem instruções longas.
O cache permanece ativo por 30 minutos e é especialmente útil em workflows agentic, onde instruções de sistema, definições de ferramentas e documentos de referência se repetem a cada chamada. Em vez de pagar o preço cheio por cada token desses em toda requisição, você paga apenas 10%.
Os três modelos GPT-5.6 no Bedrock
A família GPT-5.6 está disponível em três tiers de capacidade:
- GPT-5.6 Sol: raciocínio complexo e codificação agentic. Disponível em US East (N. Virginia e Ohio).
- GPT-5.6 Terra:平衡 para cargas de produção do dia a dia. Disponível também em US West (Oregon).
- GPT-5.6 Luna: tarefas rápidas e de alto volume como classificação e sumarização. Também em Oregon.
Todos os modelos usam a API Responses compatível com OpenAI através do endpoint bedrock-mantle. A precificação é pay-per-token e o uso conta para compromissos AWS existentes.
Cache explícito vs. implícito
A grande novidade aqui é o controle. O cache implícito (já existente) decide automaticamente o que armazenar. O cache explícito permite que você marque blocos específicos do prompt — por exemplo, toda a seção de instruções do sistema — garantindo que aquele conteúdo seja cacheado sem ambiguidade. Isso é particularmente relevante para:
- Sistemas de agentes com dezenas de ferramentas definidas
- Chatbots com instruções longas de persona e compliance
- Pipelines RAG que reutilizam documentos de contexto
- Aplicações multi-turno com histórico de conversa extenso
Controle de esforço de raciocínio
O GPT-5.6 introduz níveis de raciocínio configuráveis: none, low, medium (padrão), high e xhigh. Para tarefas simples, usar none reduz latência. Para problemas complexos, xhigh aloca mais capacidade de raciocínio. Essa granularidade permite otimizar custo e velocidade conforme a demanda real de cada requisição.
Migração para o Bedrock
A AWS fornece um token generator (aws-bedrock-token-generator) que gera credenciais temporárias a partir de roles IAM, eliminando a necessidade de chaves de longa duração. O setup é mínimo:
pip install openai aws-bedrock-token-generatorE o código de chamada é essencialmente o mesmo da API da OpenAI, trocando apenas a base_url e o método de autenticação. Para times que já usam GPT-5.6 fora da AWS, a migração é direta. Para quem está em modelos anteriores (GPT-4, GPT-4.5), o ganho com prompt caching explícito é um argumento forte para upgrade.
Por que isso importa
O custo de prompts repetidos é um gargalo silencioso em aplicações de IA em produção. Com 90% de desconto em tokens cacheados, o prompt caching explícito transforma a economia de fluxos agentic — onde um único agente pode fazer dezenas de chamadas com as mesmas instruções de sistema. Para o mercado brasileiro, onde cada centavo de custo de API é multiplicado pelo câmbio, essa otimização é especialmente relevante.
Descubra mais sobre noticiAI
Assine para receber nossas notícias mais recentes por e-mail.



