Um sistema de recuperação de imagens que não exige treinamento, chamado MulVec, liderou os resultados nos benchmarks CIRCO, CIRR e FashionIQ, segundo um pré-print na primeira versão do arXiv. A ideia central é tratar as diferentes partes de um pedido como tarefas distintas — em vez de uma única busca genérica.
Quatro papéis para uma consulta
O MulVec compila cada consulta em quatro funções nomeadas: Global (o alvo completo), Desired (conteúdo a adicionar), Preserve (conteúdo a manter) e Forbidden (conteúdo a remover). Encoders congelados produzem um vetor-alvo e vetores de “sonda” específicos para cada papel, além de evidências globais e locais dos candidatos. Uma soma ponderada fixa ordena a galeria em uma única passada, sem aprendizado de parâmetros por tarefa.
Liderança consistente
No CIRCO, o MulVec foi o melhor em todos os cortes e escalas de backbone avaliados, usando torres OpenCLIP congeladas ViT-B/32, ViT-L/14 e ViT-G/14. A margem sobre o melhor comparador no mAP@5 foi de 23,0% com ViT-B, 22,4% com ViT-L e 19,7% com ViT-G. No CIRR e no FashionIQ, o padrão se repetiu — no FashionIQ, liderou todas as 24 métricas reportadas.
O que explica o ganho
Um teste pareado procurou isolar se o tratamento explícito por papéis trazia ganho além de simplesmente aumentar o número de vetores candidatos. Em controles com ViT-L/14, o despacho por papéis superou uma leitura compartilhada em 7,08 e 5,58 pontos no CIRCO, 5,26 e 5,50 no CIRR, e 16,46 e 12,36 no FashionIQ — confirmando que a separação de intenções é o ingrediente ativo.
Para aplicações de e-commerce e moda, onde o usuário costuma pedir “mantenha o estilo, mas troque a cor”, o resultado sugere um caminho prático para busca visual por composição sem custo de treinamento adicional.
Descubra mais sobre noticiAI
Assine para receber nossas notícias mais recentes por e-mail.



