Modelos que preveem planilhas como LLMs preveem texto: o que são os Tabular LLMs
Imagine um modelo que, diante de qualquer planilha com uma coluna faltando, prevê os valores ausentes — sem treinamento prévio, sem ajuste de hiperparâmetros, do mesmo jeito que um LLM completa uma frase. Essa é a promessa dos Tabular Foundation Models, ou “tabular LLMs”, uma nova classe de modelos que está virando de cabeça para baixo a abordagem padrão para dados tabulares.
No principal benchmark da comunidade, o TabArena, todas as entradas de modelo único acima do melhor gradient-boosted tree ajustado (como XGBoost ou LightGBM) são agora desses modelos. É uma inversão completa da resposta padrão da última década, que era simplesmente “ajuste um GBDT tunado”.
Como funcionam
Um tabular foundation model é um transformer pré-treinado que trata qualquer tabela como uma sequência, similar a como um LLM processa texto. Ele codifica as colunas existentes, aprende a relação entre elas durante o pré-treinamento em milhões de tabelas, e na inferência prevê a coluna-alvo em zero-shot — sem nenhum treinamento adicional nos dados do usuário.
O modelo mais forte com pesos abertos é o TabICLv2, baseado na arquitetura Transformer com mecanismos de atenção que permitem processar tabelas de tamanhos variados. Uma reprodução independente feita pelo autor do artigo original confirmou os resultados: rodando em uma GPU AWS A10G por pouco mais de 2 horas (custo de ~US$ 2), o modelo atingiu Elo 1559 contra o oficial 1575, com 16 dos 51 datasets retornando valores idênticos até a quarta casa decimal.
Onde as árvores ainda vencem
Apesar do desempenho impressionante em zero-shot, os GBDTs tradicionais ainda levam vantagem em cenários específicos:
- Dados com muitas colunas categóricas de alta cardinalidade: os tabular LLMs têm dificuldade com vocabulários muito grandes
- Datasets pequenos com forte sinal linear: regressão logística ou árvores simples podem ser mais eficientes
- Quando o custo computacional é a prioridade absoluta: rodar XGBoost em CPU ainda é ordens de magnitude mais barato que inferência em GPU
Por que isso importa agora
Em julho de 2026, os tabular LLMs representam uma mudança de paradigma para cientistas de dados. A capacidade de prever qualquer coluna de qualquer tabela sem preparação prévia elimina boa parte do trabalho de feature engineering e tuning de hiperparâmetros. Para equipes que lidam com dezenas ou centenas de problemas de predição diferentes, o ganho de produtividade é transformador.
O fato de o modelo mais forte ter pesos abertos e rodar em hardware consumer (A10G) também democratiza o acesso: qualquer pessoa com uma GPU modesta pode reproduzir resultados de ponta. O custo total da reprodução independente — US$ 2 em cloud — é menor que uma xícara de café em São Paulo.
Descubra mais sobre noticiAI
Assine para receber nossas notícias mais recentes por e-mail.



