Um modelo analítico para entender como a IA aprende com exemplos
O aprendizado em contexto (in-context learning) é a capacidade que modelos de linguagem têm de resolver uma tarefa apenas com exemplos fornecidos no próprio prompt, sem ajuste de pesos. Apesar de ser um dos comportamentos mais importantes dos grandes modelos atuais, os mecanismos matemáticos por trás dele ainda são pouco compreendidos. Um novo preprint busca preencher essa lacuna usando ferramentas da física estatística.
Pesquisadores da Sungkyunkwan University analisaram uma versão linear do aprendizado em contexto e encontraram um ponto crítico bem definido: quando a “complexidade de amostra normalizada” atinge o valor 1, o erro médio de predição permanece finito, mas as flutuações nos parâmetros aprendidos se tornam singulares — ou seja, divergem.
O que significa “recozido” versus “resfriado”
A escolha metodológica central do trabalho é como tratar a aleatoriedade da amostra de treinamento. Na média recozida (annealed), a aleatoriedade é calculada junto com o erro. Na média resfriada (quenched, ou de cavidade), a desordem da amostra permanece nos parâmetros aprendidos. É essa segunda rota que revela a divergência da covariância no limiar — um comportamento que a média recozida esconde.
Uma leitura no estilo das transições de fase
Os autores reescreveram a equação de autoconsistência do modelo numa construção de Landau, a mesma estrutura usada para descrever transições de fase em materiais. Nessa analogia, o “parâmetro de ordem” representa o estado do modelo, a complexidade de amostra faz o papel de temperatura, e o parâmetro de regularização (ridge) atua como um campo conjugado. Os expoentes críticos relatados são 1 para o parâmetro de ordem e 2 para a resposta ao campo — um padrão de escala típico de fenômenos críticos.
Por que isso importa
Entender quando e por que o aprendizado em contexto se torna instável tem implicações práticas: ajuda a prever em que condições um modelo pode falhar ao receber poucos exemplos e como a regularização pode estabilizá-lo. O trabalho ainda é limitado — é uma versão 1 de preprint, restrito a um modelo linear de regressão, sem testar transformadores completos ou dados reais. Mas oferece uma ponte conceitual entre a física de sistemas desordenados e o comportamento de modelos de IA.
Descubra mais sobre noticiAI
Assine para receber nossas notícias mais recentes por e-mail.



