Um estudo apresentado na conferência COLM 2026 propõe uma ideia contraintuitiva: em vez de treinar modelos maiores, use os erros de modelos menores da mesma família como guia de raciocínio no momento da inferência. O método, chamado CritICL, alimenta modelos de linguagem mais fortes com exemplos das falhas de modelos mais fracos — e registrou ganhos marginais, mas consistentes, em benchmarks de matemática e ciência.
Como o CritICL funciona
A hipótese central é que os padrões de erro são compartilhados dentro de uma família de modelos: os sinais de onde um modelo fraco erra podem servir de orientação para um modelo forte. O CritICL constrói um banco offline de respostas incorretas, rótulos de modo de falha e críticas, e então recupera esses exemplos no momento da inferência — usando estratégias estáticas ou dinâmicas.
Na avaliação, o CritICL alcançou 49,8% de acurácia Pass@1 no Qwen2.5-32B-Instruct, 0,3 ponto acima do melhor baseline de escalonamento em tempo de teste. No Qwen2.5-72B-Instruct, chegou a 59,2% contra 59,0% do Consistency@5. A análise encontrou forte alinhamento entre os perfis de falha dos modelos fracos e as distribuições de erro do modelo alvo — correlações de Spearman de 0,91 para Qwen e 0,88 para Llama.
Ganhos pequenos, custo menor
O ponto mais interessante é a eficiência: o CritICL usa uma única geração por pergunta (o modo estático), contra múltiplas gerações dos métodos de escalonamento em tempo de teste. O uso médio total de tokens ficou entre 3.768 e 3.897, comparado a 4.192–7.533 dos baselines. Em resumo, aproxima-se do desempenho dos métodos caros gastando menos.
O que os resultados não provam
A evidência não é uniforme. Os valores-p foram de 0,083 no GSM8K, 0,018 no MATH, 0,641 no AMC23 e acima de 0,8 nos AIME — ou seja, sem melhora estatisticamente significativa em vários benchmarks. A avaliação se concentra em modelos Qwen e Llama e benchmarks matemáticos e de GPQA, com decodificação gulosa (temperatura 0). O banco de erros exige um custo único de construção offline, e a transferência dentro da família foi mais forte que entre famílias.
Para pesquisadores e times que constroem pipelines de raciocínio, o estudo contribui com uma direção relevante: a noção de generalização “do fraco para o forte” — popularizada em trabalhos sobre superalinhamento — pode ser aplicada de forma barata na inferência, usando erros já catalogados em vez de mais computação.
Descubra mais sobre noticiAI
Assine para receber nossas notícias mais recentes por e-mail.



