Inteligência artificial, sem ruído.
Modelos e LLMs3 min

Além do preço por token: como escolher o modelo OpenAI certo no Amazon Bedrock

Benchmark de código aberto mostra que o custo por resultado — não por token — muda o ranking de modelos e pode reduzir a fatura em até 8x.

Além do preço por token: como escolher o modelo OpenAI certo no Amazon Bedrock

O erro da planilha de preços

Quase todo mundo compara modelos de IA da mesma forma: dólares por milhão de tokens. É o número que aparece em toda página de preços — e por isso vira o número de toda planilha. Mas cargas de trabalho de produção não compram tokens. Compram resultados: um ticket resolvido, um resumo financeiro correto, uma resposta que um profissional aceitaria.

Um novo benchmark de código aberto da AWS (openai-on-aws/benchmarks-openai) mede exatamente esses multiplicadores que o preço de etiqueta ignora: quantas vezes o modelo acerta, quantos tokens ele gasta para chegar lá e, em cargas agênticas, quantas rodadas de conversa são necessárias.

O que os dados mostram

O estudo compara os modelos OpenAI no Amazon Bedrock (gpt-5.6-luna, gpt-5.6-terra e gpt-5.6-sol) com os modelos econômicos amplamente usados na API da OpenAI (gpt-5.4-mini e gpt-5.4-nano). Os resultados revelam três lições importantes:

  • Camadas de capacidade são visíveis. O modelo sol resolve 75% dos problemas de matemática AIME, contra 37% do mini, e lidera GPQA Diamond e MMLU-Pro.
  • Eficiência de tokens decidiu a fatura antes mesmo do preço mudar. Após a redução de preço de 30 de julho (luna -80%), o custo por resposta correta no AIME ficou em US$ 0,0021 para o luna, contra US$ 0,0139 para o mini.
  • Número de turnos é uma variável de preço invisível. Em tarefas de pesquisa na web com múltiplos passos, o mini levou 7,6 turnos por pergunta e custou US$ 0,40 por resposta aprovada, enquanto o luna custou US$ 0,05.

A decisão certa depende do formato da carga

O guia oferece uma estrutura simples: para tarefas de alto volume e baixa complexidade, comece com o gpt-5.6-luna; para agentes que encadeiam chamadas de ferramentas, teste luna e terra; para documentos com barra de qualidade rigorosa, o sol é a opção quando os modelos econômicos não passam no seu critério de qualidade.

O que levar para o seu projeto

A lição duradoura não é um ranking de modelos, mas um método: defina o resultado e o limiar de qualidade que sua aplicação exige, meça o custo completo de acertos e falhas, e reavalie sempre que preços, modelos ou padrões de carga mudarem. O harness de benchmark roda o mesmo código contra ambas as plataformas e pode ser reproduzido com seus próprios dados — os scripts estão no repositório público.


Descubra mais sobre noticiAI

Assine para receber nossas notícias mais recentes por e-mail.

R
Sobre o autorRedação Noticiai

Equipe editorial dedicada a explicar inteligência artificial com clareza, independência e contexto.