Por que isso importa agora
Sistemas de recomendação e busca em escala precisam transformar representações de embedding em identificadores compactos e hierárquicos — os chamados IDs semânticos. Um novo pré-print apresenta o PRQ-KMeans, tokenizador que relatou ganhos consistentes sobre o método de referência RQ-KMeans, tanto em quatro benchmarks públicos quanto em uma avaliação industrial com 16,8 milhões de representações.
O que o PRQ-KMeans faz de diferente
O PRQ-KMeans constrói uma hierarquia de códigos a partir de representações baseadas em embedding. Ele remove o componente de média global, refina centróides com atualizações ponderadas por similaridade Top-k e usa um resíduo de projeção em vez da subtração completa do codebook. Esse resíduo remove apenas o componente do centróide selecionado, permitindo eliminar a comunalidade de forma progressiva conforme a hierarquia de códigos é construída.
Ganhos reportados
Na avaliação industrial, o PRQ-KMeans reportou ganhos de 7,4% em Order HitRate, 11,8% em Order MRR, 6,4% em Click HitRate e 8,9% em Click MRR, todos medidos com corte em 50 resultados. O ajuste do tokenizador usou 7.797.542 itens e 9.046.403 registros de consulta de treino. Nos quatro benchmarks públicos, o método foi o melhor ou empatou em todas as oito métricas reportadas, superando o RQ-KMeans em todas as comparações — com ganhos mais pronunciados no LastFM, onde o Recall@20 subiu de 0,0115 para 0,0179.
O artigo também mostrou que o PRQ-KMeans usa o codebook de forma mais equilibrada: razão de código independente (ICR) de 58,45% contra 55,52% do RQ-KMeans, e índices de Gini de prefixo usado mais baixos (0,758 e 0,546 contra 0,774 e 0,569). Ablações confirmaram que o componente de projeção foi o que mais contribuiu para os ganhos.
Ressalvas necessárias
O manuscrito é a versão 2 do arXiv, de 3 de setembro de 2026, e segue sem revisão por pares. Todos os tokenizadores usaram um pipeline compartilhado de três estágios (treino, decodificação e avaliação), e os autores afirmam que o código será liberado após a aceitação. Os ganhos descrevem o conjunto industrial e os benchmarks testados — não uma garantia universal em qualquer domínio.
Descubra mais sobre noticiAI
Assine para receber nossas notícias mais recentes por e-mail.



