O duelo que muda a conta de quem usa IA para programar
Quanto vale acertar de primeira quando a alternativa custa 35 vezes menos? É essa a pergunta que a Together AI respondeu ao colocar frente a frente o DeepSeek V4 Pro 0813 (peso aberto) e o GPT-5.6 Sol no benchmark DeepSWE, que mede a capacidade de engenharia de software em tarefas reais de repositório — encontrar bugs, implementar funcionalidades e consertar código em múltiplas linguagens.
O resultado, publicado nesta terça (18/08), tem uma conclusão contraintuitiva para quem ainda escolhe modelo pela precisão no primeiro tiro: o modelo caro vence no primeiro disparo, mas o barato vence no longo prazo — e a melhor jogada é usar os dois em sequência.
O placar do DeepSWE: pass@1 e pass@k
O estudo rodou 904 execuções (452 para cada modelo), quatro tentativas por tarefa, cobrindo as 113 tarefas do DeepSWE. Na primeira tentativa, o GPT-5.6 Sol lidera com folga: 72,7% de pass@1 contra 62,8% do DeepSeek V4 Pro 0813. Mas a distância encolhe a cada nova tentativa e se inverte no pass@4: o modelo chinês atinge 88,5%, contra 85,8% do Sol.
Traduzindo: o DeepSeek V4 Pro 0813 tem alcance maior, mas precisa de mais de uma chance para chegar lá — e como cada chance custa quase nada, rodar “best-of-k” apaga a vantagem de precisão do Sol.
| Modelo | Pass@1 | Pass@2 | Pass@4 | Custo por execução |
|---|---|---|---|---|
| gpt-5.6-sol [max] | 72,7% | 81,0% | 85,8% | US$ 8,37 |
| deepseek-v4-pro-0813 [max] | 62,8% | 78,5% | 88,5% | US$ 0,24 |
A conta de custo: o que 35x compra (e o que não compra)
A US$ 0,24 por execução, o DeepSeek V4 Pro 0813 é 35 vezes mais barato que o Sol (US$ 8,37). Em valor por dólar, a diferença é brutal: 261 tarefas resolvidas por US$ 100 contra apenas 9 do Sol — cerca de 30 vezes mais trabalho entregue por dólar investido.
Mas o preço baixo tem um custo de conveniência. O DeepSeek V4 Pro 0813 é mais lento e prolixo: mediana de 146 passos e 35 minutos por execução, emitindo 101 mil tokens de saída. O Sol resolve em 53 passos e 17 minutos, com 59 mil tokens. Para quem tem um humano esperando a resposta, o Sol justifica o prêmio só pela latência.
Cobertura × confiabilidade: dois modelos, duas personalidades
A decomposição do pass@1 revela perfis opostos. O Sol é o especialista de precisão: 84,5% de confiabilidade e 61 tarefas resolvidas “quatro de quatro” tentativas. O DeepSeek V4 Pro 0813 troca isso por cobertura mais ampla (88,5% contra 85,8%), mas com confiabilidade bem menor (71,0%) e apenas 35 tarefas “quatro de quatro”.
Os modos de falha também divergem. O Sol quebra a suíte de testes existente em 20% das suas falhas — a assinatura clássica de regressão dos modelos GPT — enquanto o DeepSeek V4 Pro 0813 é bem mais conservador (11%). Na prática, o modelo barato é o mais seguro para aceitar sem revisão humana.
Por domínio e por linguagem
O Sol vence em 6 de 8 domínios, liderando com folga em modelagem de dados e serialização (92%, 28 pontos à frente), além de consultas/configuração (80), concorrência (72), build/operações (73), análise de programas (64) e conformidade de protocolo (59). O DeepSeek V4 Pro 0813 só leva um domínio: reatividade com estado (66 a 64), com empate em internals de linguagem e runtime (75 a 75).
Em linguagens, o Sol varre quatro de cinco (Python 74, Go 79, TypeScript 66, JavaScript 75). A exceção é Rust, onde o DeepSeek V4 Pro 0813 vira o jogo (65 a 60) — a única linguagem em que o modelo barato ganha de forma consistente.
A jogada de portfólio: a cascata Pro → Sol
O achado mais prático do estudo é a estratégia de roteamento. Como os modelos são moderadamente diferentes (correlação de 0,54 por tarefa) e juntos cobrem 107 das 113 tarefas (94,7%), a melhor configuração não é escolher um deles — é encadeá-los:
Rodar o DeepSeek V4 Pro 0813 primeiro e escalar para o GPT-5.6 Sol apenas quando a suíte de testes rejeitar a resposta resolve 83,0% das tarefas a US$ 3,35 cada. Isso supera o Sol sozinho (72,7% a US$ 8,37) e até um “roteador oráculo” perfeito de uma tentativa (80,8%) — porque duas tentativas independentes batem uma escolha perfeita.
O que isso significa para quem programa com IA no Brasil
Para times que pagam em reais, a lição é direta: não existe mais um único modelo “certo”. Se você precisa de precisão e baixa latência no primeiro tiro — um assistente de código interativo, por exemplo — o Sol vale o preço. Se o seu fluxo tolera retentativas (agentes autônomos, CI, revisão em lote), o DeepSeek V4 Pro 0813 entrega cobertura de flagship por uma fração do custo.
E o padrão mais inteligente é a cascata de dois estágios: deixe o modelo barato limpar a maior parte da fila e pague o premium apenas nas tarefas difíceis. É uma arquitetura que qualquer pipeline de engenharia de software pode adotar hoje, com as duas APIs disponíveis no mesmo endpoint.
Descubra mais sobre noticiAI
Assine para receber nossas notícias mais recentes por e-mail.



