Inteligência artificial, sem ruído.
Modelos e LLMs4 min

Cognition lança SWE-2: novo modelo de código iguala Fable 5.1 com custo 64% menor

SWE-2, pós-treinado sobre o Kimi K3, atinge 50% no FrontierCode com custo 64% menor — mas roda só dentro do Devin.

Cognition lança SWE-2: novo modelo de código iguala Fable 5.1 com custo 64% menor

Cognition lança o SWE-2, seu modelo de código mais capaz até agora

A Cognition, empresa por trás do agente de programação Devin, anunciou nesta semana o SWE-2, o modelo de codificação mais poderoso que já lançou. A novidade é fruto de um pós-treinamento com aprendizado por reforço (RL) sobre o Kimi K3, o modelo aberto de 2,8 trilhões de parâmetros da Moonshot AI.

O resultado impressiona pela relação custo-desempenho: o SWE-2 atinge 50,0% no FrontierCode 1.1 Main, ficando a apenas 1 ponto do Fable 5.1 — com custo 64% menor. É também o primeiro modelo da Cognition com níveis de esforço de raciocínio selecionáveis, todos treinados em uma única rodada de RL.

Por que isso importa agora

O mercado de modelos de código está em plena aceleração. Enquanto os grandes laboratórios competem por pontos de benchmark, a Cognition aposta em uma estratégia diferente: em vez de perseguir o primeiro lugar absoluto, ela quer entregar 90% da performance a uma fração do custo. Para desenvolvedores e empresas brasileiras que usam agentes de programação no dia a dia, essa é a variável que mais pesa na conta no fim do mês.

Há, porém, uma limitação importante: o SWE-2 não tem pesos abertos nem API autônoma. Ele roda exclusivamente dentro do Devin — hoje no Desktop e na CLI, com Web e Fusion chegando em seguida. Ou seja, é um avanço que fica preso ao ecossistema da Cognition.

Resultados de benchmark

BenchmarkSWE-2Kimi K3Grok 4.6Fable 5.1GPT-5.6 SolGPT-6 AstraSWE-1.7
FrontierCode 1.1 Main50,0%44,2%48,0%50,9%47,5%53,3%42,0%
DeepSWE 1.173,0%68,5%67,5%67,4%72,7%74,1%37,7%
Terminal-Bench 2.192,8%88,3%88,4%91,4%88,8%89,9%81,5%
Terminal-Bench 427,3%21,5%20,3%55,8%37,3%57,9%7,6%
Resultados publicados pela Cognition. Onde disponíveis, foram usados resultados públicos; caso contrário, cada modelo rodou em seu harness nativo com melhor esforço.

O SWE-2 lidera no Terminal-Bench 2.1 e supera a base Kimi K3 em todas as linhas. A Cognition afirma que ele fica a poucos pontos do GPT-6 Astra custando cerca de um quarto do preço. O ponto fraco claro é o Terminal-Bench 4, onde o SWE-2 fica cerca de 30 pontos atrás de Fable 5.1 e GPT-6 Astra.

Vale um alerta de método: o FrontierCode é um benchmark da própria Cognition, e os números dos concorrentes vêm da avaliação conduzida pela empresa.

Menos rodeios, mais foco

Um dos problemas do antecessor SWE-1.7 era explorar demais em tarefas simples. O SWE-2 corrige isso com o que a Cognition chama de exploração focada: no FrontierCode 1.1 Main, a versão “médium” pontua mais que o SWE-1.7 usando 58% menos turnos e custando 81% menos. A média de passos por execução cai de 127 (SWE-1.7) para 53 no nível médio, 80 no alto e 98 no máximo.

Segundo a equipe, o modelo exibe três comportamentos: cobertura de testes ponta a ponta mais forte, capacidade de contornar ferramentas bloqueadas e disciplina na verificação — quando contestado, ele re-deriva conclusões em vez de simplesmente reafirmá-las.

Como foi treinado

O treinamento combina algumas técnicas dignas de nota. A recompensa usa penalidades de custo informadas pela curva de Pareto: R = S − λ × C, onde S é o sucesso binário e C mistura custo de inferência em dólares com tempo de rollout. Cada nível de esforço tem um λ ajustado à inclinação local da fronteira do modelo base, o que torna a linha de recompensa tangente à fronteira — a única forma de subir é empurrar a própria fronteira.

A Cognition também usa um baseline de recompensa ponderado por comprimento, servidores de rollout com prefill delayer (ganhos de 10 a 20% em TPM/TPS) e decodificação especulativa via DSpark, além de kernels NVFP4 e FP8 com treinamento quantizado para manter a memória sob controle.

Limitações e transparência

No campo da confiabilidade, a Cognition afirma que o SWE-2 passou em 98,0% de 145 perguntas politicamente sensíveis sobre a China (99,8% em inglês, 95,2% em chinês simplificado). Ainda assim, a decisão de manter o modelo fechado e vinculado ao Devin limita a auditoria independente — um ponto que a comunidade de código aberto deve continuar cobrando.

Para quem já paga o Devin, o SWE-2 é gratuito até 10 de outubro de 2026. Depois disso, o acesso passa a seguir a política de cobrança da plataforma.



Descubra mais sobre noticiAI

Assine para receber nossas notícias mais recentes por e-mail.

R
Sobre o autorRedação Noticiai

Equipe editorial dedicada a explicar inteligência artificial com clareza, independência e contexto.