Inteligência artificial, sem ruído.
Modelos e LLMs2 min

Chopthin-Consensus: amostragem que preserva diversidade melhora raciocínio de LLMs em até 10,6 pontos

Chopthin-Consensus preserva diversidade na amostragem e melhora raciocínio de LLMs em até 10,6 pontos, sem treinamento.

Chopthin-Consensus: amostragem que preserva diversidade melhora raciocínio de LLMs em até 10,6 pontos

O limite do power sampling tradicional

Amostragem de potência em tempo de inferência via Monte Carlo Sequencial (SMC) melhora o raciocínio de LLMs sem pós-treinamento. Mas as abordagens existentes usam reamostragem de pesos iguais, que poda agressivamente trajetórias de baixo peso — descartando caminhos de raciocínio potencialmente corretos e degradando a diversidade genealógica do espaço de busca.

A técnica

O Chopthin-Consensus Power Sampling (CCPS) aplica o reamostrador Chopthin à decodificação de LLMs: em vez de equalizar pesos e forçar duplicação desnecessária de partículas, impõe um teto na razão entre o maior e o menor peso e carrega os pesos desiguais adiante. Isso preserva um conjunto mais rico de caminhos de raciocínio distintos, mantém a aproximação SMC ponderada inalterada em expectativa condicional e garante um limite inferior para o tamanho efetivo de amostra (ESS) pós-reamostragem.

Para explorar essa população enriquecida, o método usa um mecanismo de seleção por maioria semântica: mescla trajetórias finais idênticas em tokens, agrupa respostas semanticamente equivalentes e retorna a resposta apoiada pelo maior número de trajetórias distintas.

Resultados

Avaliado em três modelos de pesos abertos e cinco benchmarks de raciocínio, o Chopthin aumenta a cobertura oracle em 13 de 15 configurações. Combinado com a seleção por maioria semântica, o CCPS iguala ou supera a acurácia de resposta final do baseline Power-SMC em 14 de 15 configurações, com ganhos absolutos de até 10,6 pontos percentuais.

Os autores concluem que reamostragem que preserva diversidade e seleção consciente de diversidade são mecanismos complementares para raciocínio de LLM sem treinamento. O código foi disponibilizado.

Por que importa

Melhorias em tempo de inferência que não exigem pós-treinamento são especialmente valiosas para quem usa modelos abertos: você ganha capacidade de raciocínio sem pagar o custo de treino. A técnica pode ser combinada com qualquer LLM de pesos abertos para tarefas de matemática, código e raciocínio de múltiplas etapas.


Descubra mais sobre noticiAI

Assine para receber nossas notícias mais recentes por e-mail.

R
Sobre o autorRedação Noticiai

Equipe editorial dedicada a explicar inteligência artificial com clareza, independência e contexto.