Cognition lança o SWE-2, seu modelo de código mais capaz até agora
A Cognition, empresa por trás do agente de programação Devin, anunciou nesta semana o SWE-2, o modelo de codificação mais poderoso que já lançou. A novidade é fruto de um pós-treinamento com aprendizado por reforço (RL) sobre o Kimi K3, o modelo aberto de 2,8 trilhões de parâmetros da Moonshot AI.
O resultado impressiona pela relação custo-desempenho: o SWE-2 atinge 50,0% no FrontierCode 1.1 Main, ficando a apenas 1 ponto do Fable 5.1 — com custo 64% menor. É também o primeiro modelo da Cognition com níveis de esforço de raciocínio selecionáveis, todos treinados em uma única rodada de RL.
Por que isso importa agora
O mercado de modelos de código está em plena aceleração. Enquanto os grandes laboratórios competem por pontos de benchmark, a Cognition aposta em uma estratégia diferente: em vez de perseguir o primeiro lugar absoluto, ela quer entregar 90% da performance a uma fração do custo. Para desenvolvedores e empresas brasileiras que usam agentes de programação no dia a dia, essa é a variável que mais pesa na conta no fim do mês.
Há, porém, uma limitação importante: o SWE-2 não tem pesos abertos nem API autônoma. Ele roda exclusivamente dentro do Devin — hoje no Desktop e na CLI, com Web e Fusion chegando em seguida. Ou seja, é um avanço que fica preso ao ecossistema da Cognition.
Resultados de benchmark
| Benchmark | SWE-2 | Kimi K3 | Grok 4.6 | Fable 5.1 | GPT-5.6 Sol | GPT-6 Astra | SWE-1.7 |
|---|---|---|---|---|---|---|---|
| FrontierCode 1.1 Main | 50,0% | 44,2% | 48,0% | 50,9% | 47,5% | 53,3% | 42,0% |
| DeepSWE 1.1 | 73,0% | 68,5% | 67,5% | 67,4% | 72,7% | 74,1% | 37,7% |
| Terminal-Bench 2.1 | 92,8% | 88,3% | 88,4% | 91,4% | 88,8% | 89,9% | 81,5% |
| Terminal-Bench 4 | 27,3% | 21,5% | 20,3% | 55,8% | 37,3% | 57,9% | 7,6% |
O SWE-2 lidera no Terminal-Bench 2.1 e supera a base Kimi K3 em todas as linhas. A Cognition afirma que ele fica a poucos pontos do GPT-6 Astra custando cerca de um quarto do preço. O ponto fraco claro é o Terminal-Bench 4, onde o SWE-2 fica cerca de 30 pontos atrás de Fable 5.1 e GPT-6 Astra.
Vale um alerta de método: o FrontierCode é um benchmark da própria Cognition, e os números dos concorrentes vêm da avaliação conduzida pela empresa.
Menos rodeios, mais foco
Um dos problemas do antecessor SWE-1.7 era explorar demais em tarefas simples. O SWE-2 corrige isso com o que a Cognition chama de exploração focada: no FrontierCode 1.1 Main, a versão “médium” pontua mais que o SWE-1.7 usando 58% menos turnos e custando 81% menos. A média de passos por execução cai de 127 (SWE-1.7) para 53 no nível médio, 80 no alto e 98 no máximo.
Segundo a equipe, o modelo exibe três comportamentos: cobertura de testes ponta a ponta mais forte, capacidade de contornar ferramentas bloqueadas e disciplina na verificação — quando contestado, ele re-deriva conclusões em vez de simplesmente reafirmá-las.
Como foi treinado
O treinamento combina algumas técnicas dignas de nota. A recompensa usa penalidades de custo informadas pela curva de Pareto: R = S − λ × C, onde S é o sucesso binário e C mistura custo de inferência em dólares com tempo de rollout. Cada nível de esforço tem um λ ajustado à inclinação local da fronteira do modelo base, o que torna a linha de recompensa tangente à fronteira — a única forma de subir é empurrar a própria fronteira.
A Cognition também usa um baseline de recompensa ponderado por comprimento, servidores de rollout com prefill delayer (ganhos de 10 a 20% em TPM/TPS) e decodificação especulativa via DSpark, além de kernels NVFP4 e FP8 com treinamento quantizado para manter a memória sob controle.
Limitações e transparência
No campo da confiabilidade, a Cognition afirma que o SWE-2 passou em 98,0% de 145 perguntas politicamente sensíveis sobre a China (99,8% em inglês, 95,2% em chinês simplificado). Ainda assim, a decisão de manter o modelo fechado e vinculado ao Devin limita a auditoria independente — um ponto que a comunidade de código aberto deve continuar cobrando.
Para quem já paga o Devin, o SWE-2 é gratuito até 10 de outubro de 2026. Depois disso, o acesso passa a seguir a política de cobrança da plataforma.
Descubra mais sobre noticiAI
Assine para receber nossas notícias mais recentes por e-mail.



