Inteligência artificial, sem ruído.
Modelos e LLMs4 min

webAI Lança TwIL-LM: Modelos de 1.7B e 3B que Superam GPT de 120B em Raciocínio Lógico Formal

Nova família de modelos de raciocínio lógico-formal roda em hardware local com apenas 1.06 GB e supera modelos 40x maiores em tarefas de autoformalização.

webAI Lança TwIL-LM: Modelos de 1.7B e 3B que Superam GPT de 120B em Raciocínio Lógico Formal

O que é o TwIL-LM?

A webAI acaba de lançar o TwIL-LM, uma família de dois modelos de raciocínio lógico-formal com 1.7 bilhões e 3 bilhões de parâmetros, projetados para rodar em hardware local. O modelo de 3B, chamado TwIL-LM3, é um fine-tune mesclado do SmolLM3-3B; a versão de 1.7B é um adaptador LoRA PEFT sobre o SmolLM2-1.7B-Instruct. Ambos fazem autoformalização: traduzem linguagem natural para lógica de primeira ordem e verificam se uma conclusão decorre logicamente das premissas.

O feito mais impressionante divulgado pela webAI é que o TwIL-LM3 supera o gpt-oss-120b — um modelo 40 vezes maior — em quatro das cinco categorias de raciocínio formal. E tudo isso rodando localmente: a versão quantizada Q4_K_M do modelo de 1.7B ocupa apenas 1,06 GB e a de 3B, 1,78 GB. Isso significa que qualquer laptop moderno ou até mesmo um smartphone consegue executar raciocínio lógico de alto nível sem depender da nuvem.

Por que isso importa agora?

Em agosto de 2026, a tendência de modelos pequenos e eficientes — os chamados Small Language Models (SLMs) — está redefinindo o que é possível executar on-device. O TwIL-LM é relevante para setores onde os dados não podem sair do dispositivo: compliance e RegTech, serviços financeiros, saúde e farmacêutica, operações jurídicas e pesquisa em métodos formais. A webAI posiciona o modelo para ambientes regulados onde privacidade e auditoria são inegociáveis.

Além disso, o TwIL-LM3 atinge 32,9 respostas por segundo com gerações de apenas 482 tokens em média — quase 8× mais rápido que o gpt-oss-120b na mesma tarefa, que produz 4,2 respostas por segundo com 801 tokens.

Como o TwIL-LM3 foi construído?

O pipeline de treinamento tem quatro estágios sobre o modelo base SmolLM3-3B:

  1. LoRA SFT: fine-tuning supervisionado com adaptadores de baixa patente sobre um corpus sintético de lógica formal.
  2. Checkpoint Fusion: média dos checkpoints intermediários do SFT no espaço de parâmetros, reduzindo variância.
  3. WiSE-FT (λ = 0,25): interpolação entre o modelo fine-tunado e o base pré-treinado, retendo apenas 25% do delta. Esse passo é o que impede o colapso das capacidades gerais — a webAI testou uma versão sem interpolação que pontuou melhor no domínio (macro gate 0,515), mas perdeu ~12 pontos nas tarefas held-out.
  4. MGPO (GRPO com verificador programático): estágio de otimização com política de grupo e entropia ponderada, usando um verificador simbólico como recompensa.

O checkpoint publicado é o passo 2071 desse pipeline.

Desempenho

Comparação entre TwIL-LM3 e gpt-oss-120b. Fonte: webAI model cards no Hugging Face.
MétricaTwIL-LM3 (3B)gpt-oss-120b
Média 6 pistas (Track A)0,44880,5192
Macro Gate0,42180,3757
Respostas/segundo32,94,2
Tokens por geração (média)482801

O TwIL-LM3 lidera todos os modelos até o LFM2.5-8B-A1B nas seis pistas objetivas com um terço dos parâmetros. Contra o Qwen3-8B, perde no macro gate (0,4218 vs 0,5336), mas a diferença desaparece sob avaliação rigorosa (strict-7: 0,1971 vs 0,2093).

Transferência para tarefas gerais

O TwIL-LM3 melhora +26% no domínio (macro gate de 0,336 para 0,422) enquanto também ganha +0,022 na média held-out. É o único modelo do projeto que ganha em ambas as frentes. O LogicBench sobe para 0,7167; o GSM8K cai levemente para 0,8733; e o IFEval regride para 0,6433.

A versão de 1.7B tem um perfil diferente: ganhos no LogicBench BQA (0,563→0,590), mas quedas no GSM8K (0,413→0,380) e ARC-C (0,587→0,463).

Limitações importantes

  • Licença não comercial: ambos os checkpoints usam a webAI Non-Commercial License 1.0. Uso em produção com fins lucrativos exige acordo separado.
  • Não é um verificador: a FOL gerada pelo modelo é plausível, mas não garantida. A webAI recomenda parear o modelo com um solver simbólico ou Lean antes de confiar no resultado.
  • O modelo de imprensa (TwIL-LM3*) não é o publicado: os números de 96,4 em indução de regras e 87,6 em parsing semântico citados no anúncio são do checkpoint não liberado, não do TwIL-LM3 disponível.

O TwIL-LM representa um avanço significativo em raciocínio lógico formal on-device, mostrando que modelos pequenos com treinamento especializado podem superar modelos ordens de magnitude maiores em tarefas bem definidas — desde que o pipeline de treinamento preserve as capacidades gerais do modelo base.


Descubra mais sobre noticiAI

Assine para receber nossas notícias mais recentes por e-mail.

R
Sobre o autorRedação Noticiai

Equipe editorial dedicada a explicar inteligência artificial com clareza, independência e contexto.