O erro da planilha de preços
Quase todo mundo compara modelos de IA da mesma forma: dólares por milhão de tokens. É o número que aparece em toda página de preços — e por isso vira o número de toda planilha. Mas cargas de trabalho de produção não compram tokens. Compram resultados: um ticket resolvido, um resumo financeiro correto, uma resposta que um profissional aceitaria.
Um novo benchmark de código aberto da AWS (openai-on-aws/benchmarks-openai) mede exatamente esses multiplicadores que o preço de etiqueta ignora: quantas vezes o modelo acerta, quantos tokens ele gasta para chegar lá e, em cargas agênticas, quantas rodadas de conversa são necessárias.
O que os dados mostram
O estudo compara os modelos OpenAI no Amazon Bedrock (gpt-5.6-luna, gpt-5.6-terra e gpt-5.6-sol) com os modelos econômicos amplamente usados na API da OpenAI (gpt-5.4-mini e gpt-5.4-nano). Os resultados revelam três lições importantes:
- Camadas de capacidade são visíveis. O modelo sol resolve 75% dos problemas de matemática AIME, contra 37% do mini, e lidera GPQA Diamond e MMLU-Pro.
- Eficiência de tokens decidiu a fatura antes mesmo do preço mudar. Após a redução de preço de 30 de julho (luna -80%), o custo por resposta correta no AIME ficou em US$ 0,0021 para o luna, contra US$ 0,0139 para o mini.
- Número de turnos é uma variável de preço invisível. Em tarefas de pesquisa na web com múltiplos passos, o mini levou 7,6 turnos por pergunta e custou US$ 0,40 por resposta aprovada, enquanto o luna custou US$ 0,05.
A decisão certa depende do formato da carga
O guia oferece uma estrutura simples: para tarefas de alto volume e baixa complexidade, comece com o gpt-5.6-luna; para agentes que encadeiam chamadas de ferramentas, teste luna e terra; para documentos com barra de qualidade rigorosa, o sol é a opção quando os modelos econômicos não passam no seu critério de qualidade.
O que levar para o seu projeto
A lição duradoura não é um ranking de modelos, mas um método: defina o resultado e o limiar de qualidade que sua aplicação exige, meça o custo completo de acertos e falhas, e reavalie sempre que preços, modelos ou padrões de carga mudarem. O harness de benchmark roda o mesmo código contra ambas as plataformas e pode ser reproduzido com seus próprios dados — os scripts estão no repositório público.
Descubra mais sobre noticiAI
Assine para receber nossas notícias mais recentes por e-mail.



