Inteligência artificial, sem ruído.
Modelos e LLMs3 min

Tabular LLMs: os modelos que preveem planilhas como GPT prevê texto

Nova classe de modelos prevê qualquer coluna de qualquer tabela sem treinamento prévio, superando XGBoost no principal benchmark da comunidade.

Tabular LLMs: os modelos que preveem planilhas como GPT prevê texto

Modelos que preveem planilhas como LLMs preveem texto: o que são os Tabular LLMs

Imagine um modelo que, diante de qualquer planilha com uma coluna faltando, prevê os valores ausentes — sem treinamento prévio, sem ajuste de hiperparâmetros, do mesmo jeito que um LLM completa uma frase. Essa é a promessa dos Tabular Foundation Models, ou “tabular LLMs”, uma nova classe de modelos que está virando de cabeça para baixo a abordagem padrão para dados tabulares.

No principal benchmark da comunidade, o TabArena, todas as entradas de modelo único acima do melhor gradient-boosted tree ajustado (como XGBoost ou LightGBM) são agora desses modelos. É uma inversão completa da resposta padrão da última década, que era simplesmente “ajuste um GBDT tunado”.

Como funcionam

Um tabular foundation model é um transformer pré-treinado que trata qualquer tabela como uma sequência, similar a como um LLM processa texto. Ele codifica as colunas existentes, aprende a relação entre elas durante o pré-treinamento em milhões de tabelas, e na inferência prevê a coluna-alvo em zero-shot — sem nenhum treinamento adicional nos dados do usuário.

O modelo mais forte com pesos abertos é o TabICLv2, baseado na arquitetura Transformer com mecanismos de atenção que permitem processar tabelas de tamanhos variados. Uma reprodução independente feita pelo autor do artigo original confirmou os resultados: rodando em uma GPU AWS A10G por pouco mais de 2 horas (custo de ~US$ 2), o modelo atingiu Elo 1559 contra o oficial 1575, com 16 dos 51 datasets retornando valores idênticos até a quarta casa decimal.

Onde as árvores ainda vencem

Apesar do desempenho impressionante em zero-shot, os GBDTs tradicionais ainda levam vantagem em cenários específicos:

  • Dados com muitas colunas categóricas de alta cardinalidade: os tabular LLMs têm dificuldade com vocabulários muito grandes
  • Datasets pequenos com forte sinal linear: regressão logística ou árvores simples podem ser mais eficientes
  • Quando o custo computacional é a prioridade absoluta: rodar XGBoost em CPU ainda é ordens de magnitude mais barato que inferência em GPU

Por que isso importa agora

Em julho de 2026, os tabular LLMs representam uma mudança de paradigma para cientistas de dados. A capacidade de prever qualquer coluna de qualquer tabela sem preparação prévia elimina boa parte do trabalho de feature engineering e tuning de hiperparâmetros. Para equipes que lidam com dezenas ou centenas de problemas de predição diferentes, o ganho de produtividade é transformador.

O fato de o modelo mais forte ter pesos abertos e rodar em hardware consumer (A10G) também democratiza o acesso: qualquer pessoa com uma GPU modesta pode reproduzir resultados de ponta. O custo total da reprodução independente — US$ 2 em cloud — é menor que uma xícara de café em São Paulo.


Descubra mais sobre noticiAI

Assine para receber nossas notícias mais recentes por e-mail.

R
Sobre o autorRedação Noticiai

Equipe editorial dedicada a explicar inteligência artificial com clareza, independência e contexto.