Inteligência artificial, sem ruído.
Agentes de IA2 min

Prompt mal especificado encarece agente de codificação em até 29,7%, mostra estudo

Benchmark com 2.700 execuções controladas indica que manter apenas a história de usuário eleva o custo de agente de codificação em 29,7% em média, com picos de 115%.

Prompt mal especificado encarece agente de codificação em até 29,7%, mostra estudo

A pergunta que o estudo responde

Faz diferença escrever um prompt completo ou apenas uma história de usuário enxuta para um agente de codificação? Um benchmark controlado indica que sim — e a diferença aparece principalmente na conta. Manter apenas a história de usuário (sem cenários de aceitação e especificações detalhadas) foi associado a um custo de preço de lista 29,7% maior e a 16,4% mais turnos do agente.

Como o teste foi montado

O experimento cobriu 2.700 execuções controladas, combinando cinco tarefas de codificação com 12 especificações de prompt e três níveis de esforço de raciocínio, repetindo cada combinação 15 vezes. O modelo foi o Kimi K3, executado via Modal a temperatura 1,0, usando o mini-swe-agent na imagem Docker padrão do SWE-bench. O ambiente não tinha acesso à rede e incluía triagem contra vazamento de soluções.

O que varia com a especificação

O efeito não foi uniforme. Remover apenas a seção de cenários de aceitação foi associado a 7,0% mais turnos, com efeito incerto sobre a taxa de resolução. Já no corte para história de usuário pura, as diferenças de custo por tarefa foram de 13%, 16%, 21%, 24% e 115%. A diferença de taxa de resolução foi estimada em -1,9 ponto percentual, com intervalo de credibilidade que cruza o zero — ou seja, o custo subiu de forma clara, mas o efeito sobre resolver ou não a tarefa permanece incerto.

Lição prática para times

Para equipes que usam agentes de codificação com cobrança por uso, a mensagem é direta: especificações mais completas — com critérios de aceitação bem definidos — tendem a reduzir a conta, principalmente porque o agente dá menos voltas antes de chegar a uma solução. Como os resultados vêm de um modelo e conjunto de tarefas específicos, vale reproduzir o teste com o próprio fluxo de trabalho antes de generalizar.


Descubra mais sobre noticiAI

Assine para receber nossas notícias mais recentes por e-mail.

R
Sobre o autorRedação Noticiai

Equipe editorial dedicada a explicar inteligência artificial com clareza, independência e contexto.