A Google Research apresentou o TabFM, um modelo fundacional para dados tabulares que promete eliminar boa parte do trabalho manual de engenharia de features e otimização de hiperparâmetros. Em vez de treinar um modelo do zero para cada nova tabela, o TabFM trata a predição como um problema de in-context learning (ICL): ele recebe todo o dataset — exemplos de treino e linhas de teste — como um único prompt e gera predições em um único forward pass, sem ajuste de pesos.
O problema: dados tabulares ainda exigem muito trabalho manual
Dados tabulares são a espinha dorsal da infraestrutura de dados empresariais, usados em tarefas como previsão de churn, detecção de fraudes e classificação de clientes. Algoritmos como XGBoost, Random Forest e AdaBoost dominam há anos, mas o ciclo de vida de implantação é custoso: cada novo dataset exige horas de engenharia de features específica do domínio e ajuste fino de hiperparâmetros. O TabFM ataca exatamente esse gargalo.
Como o TabFM funciona: três mecanismos principais
A arquitetura do TabFM combina ideias do TabPFN e do TabICL em um design híbrido com três etapas:
- Attention alternada entre linhas e colunas: a tabela bruta passa por um módulo de atenção multilayer que alterna entre colunas (features) e linhas (exemplos). Isso captura interações complexas entre features e dependências entre linhas sem engenharia manual.
- Compressão de linhas: cada linha é comprimida em um vetor denso único, preservando a informação contextualizada.
- In-context learning com Transformer: um Transformer opera sobre a sequência de embeddings comprimidos, realizando atenção apenas sobre esses vetores — e não sobre a grade bruta — o que reduz drasticamente o custo computacional.
Treinamento em escala com dados sintéticos
Um dos maiores desafios para modelos fundacionais de dados tabulares é a escassez de datasets públicos grandes e diversos — tabelas industriais geralmente contêm esquemas proprietários e dados sensíveis. Para contornar isso, o TabFM foi treinado exclusivamente em centenas de milhões de datasets sintéticos, gerados dinamicamente por modelos causais estruturais (SCMs) com funções aleatórias variadas. Essa abordagem permite cobrir uma ampla gama de distribuições e relações complexas, fazendo com que o modelo generalize bem para tabelas reais nunca vistas.
Benchmark: TabArena e desempenho competitivo
O modelo foi avaliado no TabArena, um sistema de benchmark vivo que calcula Elo scores com base em vitórias head-to-head. A avaliação cobriu 38 datasets de classificação e 13 de regressão, com tamanhos de 700 a 150.000 amostras. Duas configurações foram testadas:
- TabFM: versão direta, sem tuning ou validação cruzada.
- TabFM-Ensemble: incorpora cross features e SVD, com ensemble de 32 modelos ponderados por mínimos quadrados não negativos. Para classificação, inclui calibração Platt.
Os resultados mostram que o TabFM-Ensemble supera ou iguala métodos supervisionados fortemente ajustados, como XGBoost e Random Forest, tanto em classificação quanto em regressão. Os Elo scores detalhados e as taxas de vitória por dataset estão disponíveis no GitHub do projeto.
Limitações e pontos de atenção
Embora o TabFM elimine a necessidade de treinamento específico por dataset, ele ainda depende de dados sintéticos para pré-treinamento, o que pode não cobrir todos os padrões de dados reais — especialmente aqueles com distribuições muito diferentes das simuladas. Além disso, o modelo é voltado para classificação e regressão; tarefas como previsão de séries temporais ou dados com estruturas hierárquicas complexas não foram abordadas. O desempenho do TabFM (sem ensemble) em datasets muito pequenos ou com features categóricas de alta cardinalidade ainda precisa ser mais explorado.
Disponibilidade e integração com BigQuery
O TabFM já está disponível nos repositórios Hugging Face e GitHub. Nas próximas semanas, será integrado ao Google BigQuery ML, permitindo que usuários realizem classificação e regressão com um simples comando AI.PREDICT em SQL — sem necessidade de conhecimento em ML.
Por que isso importa no mundo real
O TabFM representa um passo concreto para democratizar o acesso a modelos preditivos de alto desempenho em dados tabulares. Ao reduzir o tempo de engenharia de features e tuning, ele permite que analistas de dados e cientistas de dados foquem em interpretação e ação, em vez de repetir ciclos de ajuste. Se a promessa se confirmar em escala, pode mudar a forma como empresas pequenas e médias adotam machine learning em seus fluxos de dados.
Links úteis
Descubra mais sobre noticiAI
Assine para receber nossas notícias mais recentes por e-mail.



