Inteligência artificial, sem ruído.
Pesquisa e Ciência2 min

PRQ-KMeans aprimora tokenização semântica para busca e recomendação

Novo tokenizador de IDs semânticos supera RQ-KMeans em quatro benchmarks públicos e em avaliação industrial com 16,8 milhões de representações.

PRQ-KMeans aprimora tokenização semântica para busca e recomendação

Por que isso importa agora

Sistemas de recomendação e busca em escala precisam transformar representações de embedding em identificadores compactos e hierárquicos — os chamados IDs semânticos. Um novo pré-print apresenta o PRQ-KMeans, tokenizador que relatou ganhos consistentes sobre o método de referência RQ-KMeans, tanto em quatro benchmarks públicos quanto em uma avaliação industrial com 16,8 milhões de representações.

O que o PRQ-KMeans faz de diferente

O PRQ-KMeans constrói uma hierarquia de códigos a partir de representações baseadas em embedding. Ele remove o componente de média global, refina centróides com atualizações ponderadas por similaridade Top-k e usa um resíduo de projeção em vez da subtração completa do codebook. Esse resíduo remove apenas o componente do centróide selecionado, permitindo eliminar a comunalidade de forma progressiva conforme a hierarquia de códigos é construída.

Ganhos reportados

Na avaliação industrial, o PRQ-KMeans reportou ganhos de 7,4% em Order HitRate, 11,8% em Order MRR, 6,4% em Click HitRate e 8,9% em Click MRR, todos medidos com corte em 50 resultados. O ajuste do tokenizador usou 7.797.542 itens e 9.046.403 registros de consulta de treino. Nos quatro benchmarks públicos, o método foi o melhor ou empatou em todas as oito métricas reportadas, superando o RQ-KMeans em todas as comparações — com ganhos mais pronunciados no LastFM, onde o Recall@20 subiu de 0,0115 para 0,0179.

O artigo também mostrou que o PRQ-KMeans usa o codebook de forma mais equilibrada: razão de código independente (ICR) de 58,45% contra 55,52% do RQ-KMeans, e índices de Gini de prefixo usado mais baixos (0,758 e 0,546 contra 0,774 e 0,569). Ablações confirmaram que o componente de projeção foi o que mais contribuiu para os ganhos.

Ressalvas necessárias

O manuscrito é a versão 2 do arXiv, de 3 de setembro de 2026, e segue sem revisão por pares. Todos os tokenizadores usaram um pipeline compartilhado de três estágios (treino, decodificação e avaliação), e os autores afirmam que o código será liberado após a aceitação. Os ganhos descrevem o conjunto industrial e os benchmarks testados — não uma garantia universal em qualquer domínio.


Descubra mais sobre noticiAI

Assine para receber nossas notícias mais recentes por e-mail.

R
Sobre o autorRedação Noticiai

Equipe editorial dedicada a explicar inteligência artificial com clareza, independência e contexto.