Inteligência artificial, sem ruído.
Pesquisa e Ciência2 min

RA-OPD filtra conflitos na destilação e eleva notas em matemática e código

Filtro descarta respostas em que a orientação do professor conflita com o resultado verificado e eleva notas em matemática e código.

RA-OPD filtra conflitos na destilação e eleva notas em matemática e código

Filtrar os sinais que se contradizem na destilação

Na destilação on-policy, um modelo “estudante” gera uma resposta e um “professor” fornece orientação token a token. O problema: às vezes a orientação do professor entra em conflito com o resultado final verificado. Um novo preprint propõe um filtro para descartar justamente essas amostras contraditórias — e reporta notas mais altas em matemática e código.

O método se chama RA-OPD (Reward-Aligned On-Policy Distillation). Nos experimentos dos autores, ele teve os maiores resultados médios nas comparações de matemática e código testadas, com tempo total de treinamento de 4,48 horas — perto das 4,38 horas da destilação on-policy padrão.

Uma regra para sinais conflitantes

O RA-OPD adiciona uma checagem no nível de trajetória: combina os sinais token a token em um único retorno de destilação para a resposta amostrada completa e compara esse retorno com uma recompensa de resultado verificada. Uma resposta final correta recebe recompensa binária de um; incorreta, zero. O método mantém trajetórias que satisfazem a regra de alinhamento, filtra as conflitantes e trata trajetória de retorno zero como neutra.

Os experimentos usaram configurações com Qwen3 e DeepSeek-R1 como estudante e professor, com dados do DAPO-Math-17K para matemática e do Eurus-2-RL-Data-Code-25K para código, cobrindo sete benchmarks de matemática e três de código.

Resultados reportados

Nos dois cenários de estudante Qwen3, o RA-OPD teve a maior média. No Qwen3-4B-Base, o avg@k foi 45,88 — 5,20 pontos acima do OPD e 3,52 acima do ExOPD. No Qwen3-8B-Base, chegou a 49,43, 5,09 pontos acima do OPD. A avaliação final usou checkpoints congelados, com 32 amostras para cada problema AIME e AMC, oito para os demais benchmarks de matemática e quatro para código. O documento é um preprint de 28 de agosto de 2026 e aguarda revisão por pares.



Descubra mais sobre noticiAI

Assine para receber nossas notícias mais recentes por e-mail.

R
Sobre o autorRedação Noticiai

Equipe editorial dedicada a explicar inteligência artificial com clareza, independência e contexto.