Sua conta de inferência de LLM em produção raramente é igual a input_tokens × taxa_de_input. Provedores destacam o preço de input porque é o número menor. O tráfego real de produção paga por output, tokens de raciocínio ocultos, prefixos repetidos, tráfego de testes não-produtivos e tiers de contexto que você cruzou sem perceber. A diferença entre o orçamento e a fatura é previsível — se você souber onde os multiplicadores se escondem.
Os cinco multiplicadores entre o preço de tabela e a fatura real
1. A proporção input:output
O Claude Sonnet 4.6 lista US$3/M de tokens de input e US$15/M de output. Uma carga conversacional com proporção 1:2 já triplica a taxa efetiva em relação ao número de input. Verifique seus últimos 30 dias: se o output é 2× ou 3× o volume de input, sua taxa real está longe da página de preços.
2. Tokens de raciocínio invisíveis
Modelos com pensamento estendido (Claude adaptive thinking, OpenAI o3/o4-mini) emitem tokens que o usuário nunca vê. No Claude Opus 4.8 a US$25 por milhão de output, 500 tokens visíveis mais 2.000 tokens de raciocínio custam 5× mais do que apenas os 500 tokens visíveis. Inspecione o usage em toda resposta — modelos de raciocínio frequentemente dominam o gasto mesmo em tarefas simples.
3. Vazamento de ambientes não-produtivos
Pipelines de CI repetem prompts a cada PR. Staging espelha produção. Testes de carga batem no endpoint do modelo sem considerar custo. Sem tags de ambiente, tudo é cobrado como produção. Times frequentemente descobrem que CI e staging representam 30-50% do volume total de tokens.
4. Verbosidade do modelo
O mesmo prompt de classificação em um modelo verboso retorna parágrafos; em um modelo conciso retorna um rótulo. Você paga por cada token de output. Restrições no prompt (“responda apenas com o rótulo, sem explicação”) cortam o output em 60-80% em tarefas estruturadas.
5. Tiers de contexto longo
GPT-5.5 cobra US$5/US$30 por milhão abaixo de 272K tokens de input; acima desse limiar, passa para US$10/US$45. Pipelines RAG e agentes multi-turn cruzam esses limites em uma fração significativa das requisições. Audite o p95 e p99 de contexto de input contra os limites de cada provedor.
Medições reais no DigitalOcean Serverless Inference
Em testes com prompts fixos e temperatura=0, o mesmo prompt de classificação apresentou variação de 36× no custo por requisição apenas trocando o modelo — de US$0,00004 no openai-gpt-oss-20b para US$0,00148 no Claude Sonnet. A 700 mil requisições de classificação por mês, essa diferença é de US$28 contra US$1.037.
Para uma tarefa de raciocínio com GPT-5, o custo foi de US$0,034 por requisição — 840× mais caro que a classificação, porque o raciocínio gerou 3.411 tokens de output contra 80 na classificação.
Quatro alavancas para reduzir a conta
- Cache de prompts: leituras de cache no Anthropic custam 10% do input base. Um prompt de sistema de 1M de tokens com 80% de cache hit transforma a economia.
- Inferência em batch: ~50% de desconto para cargas assíncronas com SLA de 24h.
- Descontos por volume: muitos times que se qualificam nunca pedem.
- Roteamento por tarefa: classificação vai para modelo barato; Q&A para modelo médio; raciocínio complexo sobe para o modelo caro. Um roteador documentado reduziu o custo mensal em 39,6% contra baseline Sonnet-only.
A conclusão prática: visibilidade vem antes da otimização. Tags de ambiente, métricas de taxa de cache, separação de tokens de raciocínio e breakdown por tarefa transformam uma fatura surpresa em uma equação que você controla.
Descubra mais sobre noticiAI
Assine para receber nossas notícias mais recentes por e-mail.



