Recomendação com a eficiência de um transformer
Sistemas de recomendação precisam filtrar, entre milhões de itens, os poucos que valem a pena mostrar ao usuário — e fazer isso em milissegundos. O preprint TransRetrieval (26 de agosto de 2026) propõe um sistema de recuperação baseado em transformer que reporta 0,603 de Recall@2000 (entre os 2.000 candidatos) contra 0,576 da linha de base de produção, usando 35% menos FLOPs.
Onde a economia de cálculo aparece
A principal decisão de design é comprimir os atributos do item-alvo em um único token via MLP de três camadas — o que cortou os MFLOPs em cerca de 85% numa configuração, com queda de só 2,1 pontos no recall. Informações de domínio entram por adição elemento a elemento, permitindo compartilhar todos os parâmetros do transformer entre domínios diferentes (como roupas, eletrônicos e alimentos).
O teste de negócio — e suas ressalvas
Em um teste A/B online de um mês, expondo o modelo a 5% do tráfego de produção, o TransRetrieval-128D5L serviu 230 consultas por segundo com latência p99 abaixo de 40 ms, e reportou ganho de receita de 2,53% (intervalo de confiança de 2,22% a 2,70%).
Mas é preciso cautela: o preprint não detalha a aleatorização, o tamanho das unidades de tráfego nem o plano de análise, então o impacto causal do modelo não pode ser confirmado pelos dados divulgados. O Recall@2000 é uma métrica offline, e ganhos nela não se traduzem automaticamente em resultado de negócio. Ainda assim, para equipes que operam recomendação em larga escala, a combinação de “mais recall com menos computação” é uma direção a observar.
Descubra mais sobre noticiAI
Assine para receber nossas notícias mais recentes por e-mail.



