Inteligência artificial, sem ruído.
Open Source8 min

Perplexity abre modelos de busca multimodal que combinam índice 9B e consulta 0,6B

Perplexity libera embeddings multimodais abertos que pesquisam texto, imagens e PDFs com índice 9B e consultas de 0,6B.

Perplexity abre modelos de busca multimodal que combinam índice 9B e consulta 0,6B

A Perplexity lançou em 6 de outubro de 2026 a família aberta pplx-embed-v2-late, dois modelos de embeddings multimodais voltados a busca em texto, imagens e páginas renderizadas de PDF. A novidade relevante não é apenas o tamanho — 0,6B e 9B parâmetros — mas a possibilidade de criar um índice com o modelo maior e atender consultas com o menor, no mesmo espaço vetorial. Para equipes que constroem RAG, busca documental ou agentes, isso abre uma troca prática entre qualidade de indexação e latência de produção.

Os pesos estão no Hugging Face sob licença MIT. A Perplexity afirma que os dois checkpoints funcionam com sentence-transformers 6.0 ou superior e transformers 5.4 ou superior; a empresa ainda não anunciou um endpoint hospedado para esses modelos na API. Portanto, a adoção hoje implica operar a inferência e o índice por conta própria.

O que a Perplexity lançou

pplx-embed-v2-late é uma família de recuperadores de interação tardia, no estilo ColBERT, construída sobre Qwen3.5 com atenção bidirecional. Em vez de transformar todo documento em um único vetor, o modelo mantém um vetor de 128 dimensões para cada token. Na consulta, aplica MaxSim: para cada token da pergunta, encontra o token mais semelhante no documento e soma esses melhores alinhamentos.

Esse desenho tenta ocupar o espaço entre dois extremos. Embeddings densos tradicionais são baratos: cada documento gera um vetor e a busca usa produto interno aproximado. Cross-encoders, por outro lado, leem consulta e documento juntos e podem capturar relações mais ricas, mas custam uma passagem de modelo por candidato. A interação tardia pré-calcula os vetores do documento como um índice, mas preserva granularidade suficiente para comparar partes específicas de uma pergunta com partes específicas de uma página.

CheckpointParâmetros ativosViDoRe v3 (imagem)ViDoRe v3 (Markdown)Uso indicado
pplx-embed-v2-late-0.6b340 milhões62,3 nDCG@1061,2 nDCG@10Consulta com menor custo e execução local
pplx-embed-v2-late-9b7,4 bilhões65,2 nDCG@1064,7 nDCG@10Indexação e máxima qualidade
Métricas divulgadas nos cartões de modelo da Perplexity; nDCG@10 mede qualidade de ordenação dos dez primeiros resultados.

Por que documentos visuais mudam o problema de busca

Em repositórios reais, informação não chega somente como texto limpo: há PDFs escaneados, slides, formulários, tabelas, gráficos e páginas com layout. O caminho usual é extrair texto, aplicar OCR quando necessário e indexar os trechos. Esse fluxo continua útil, mas pode perder a relação espacial entre rótulo e valor, a estrutura de uma tabela ou informação dentro de uma figura. Segundo a Perplexity, os modelos podem representar uma página renderizada diretamente e recuperá-la a partir de uma consulta textual, sem depender de OCR ou de texto previamente parseado.

Isso não significa que OCR deixa de ser necessário em todos os produtos. Busca auditável, extração de campos, citações textuais e filtros estruturados ainda exigem pipeline de texto. A proposta é complementar: a recuperação visual pode encontrar páginas candidatas que um índice textual omitiu; então o sistema pode aplicar OCR, um parser ou um modelo de leitura na etapa seguinte.

O diferencial operacional: índice grande, consulta menor

Os dois modelos compartilham um espaço de embeddings. Na configuração assimétrica, uma equipe gera os vetores do acervo com o modelo de 9B e codifica as perguntas online com o de 0,6B. A empresa diz que essa combinação elevou a média em 1,6 ponto percentual nos benchmarks específicos de domínio em relação ao uso do 0,6B nos dois lados, sem aumentar o custo de codificação da consulta.

A assimetria faz sentido porque indexar é uma atividade offline, paralelizável e amortizada por muitas consultas. Já transformar cada pergunta em vetores entra no caminho crítico de latência. Para uma base de manuais, contratos ou documentos internos que muda lentamente, usar mais computação uma vez para indexar e menos computação em cada busca pode ser uma escolha racional. O custo não desaparece: índices multi-vetor guardam representações por token e tornam o cálculo de candidatos mais caro do que em ANN de vetor único. Armazenamento, RAM/VRAM e engenharia do mecanismo de busca precisam entrar na conta antes de migrar um RAG existente.

Resultados divulgados e o que eles demonstram

A Perplexity relata que o modelo de 9B alcançou 92,4% de acurácia no MADQA, benchmark de perguntas sobre 800 PDFs heterogêneos e mais de 18 mil páginas, usando um agente com Gemini 3.5 Flash; o 0,6B marcou 90,1%. No BrowseComp+, voltado a recuperação para perguntas complexas, o 9B atingiu 64,0% e ficou 4,9 pontos acima do próximo modelo ColBERT avaliado, segundo a empresa.

Esses números são promissores, mas devem ser lidos no escopo declarado. A avaliação MADQA mede um sistema composto por recuperador e agente, não somente o embedding; mudanças no agente, no prompt ou na indexação podem alterar o resultado. A Perplexity informa que excluiu da mistura de treino conjuntos ligados aos benchmarks avaliados, uma decisão que reduz risco de contaminação, porém o relatório técnico completo ainda é prometido para este ano. Não há, por enquanto, uma auditoria independente nem resultados suficientes para concluir que o desempenho se repetirá em acervos jurídicos, financeiros ou corporativos brasileiros.

Como testar sem confundir recuperação com geração

O cartão de modelo mostra uma integração direta com MultiVectorEncoder. O ponto importante é separar encode_query de encode_document, pois o modelo usa marcadores distintos para os dois papéis. A Perplexity também orienta codificar lotes de texto e de imagem separadamente; misturar ambos no mesmo lote não é suportado.

from sentence_transformers import MultiVectorEncoder
from PIL import Image

# Use o modelo menor primeiro para medir custo e qualidade local.
model = MultiVectorEncoder(
    "perplexity-ai/pplx-embed-v2-late-0.6b",
    device="cuda",
)

# A consulta e o documento têm papéis distintos no recuperador.
query = model.encode_query(["qual cláusula define o prazo?"])
document = model.encode_document(["O prazo para resposta é de 15 dias."])
score = model.similarity(query, document)

# Para uma página, converta a imagem para RGB antes da codificação.
page = Image.open("pagina-do-pdf.png").convert("RGB")
page_embedding = model.encode_document([page])

Antes de trocar um pipeline em produção, a prática mais segura é montar um conjunto de consultas reais, com respostas e páginas esperadas, e comparar recall, precisão nos primeiros resultados, latência p95, tamanho do índice e custo de reindexação. Um ganho de benchmark pode não compensar uma expansão de armazenamento se o acervo for curto, textual e já bem segmentado.

Impacto para equipes no Brasil

Há aplicações diretas em bases de documentos de empresas, escritórios, órgãos públicos, universidades e times de suporte: localizar uma página de contrato por descrição, buscar em apresentações técnicas, recuperar um quadro em relatório de auditoria ou conectar um agente a manuais com diagramas. A licença MIT reduz a barreira jurídica para testes e adaptações. Ao mesmo tempo, dados sensíveis exigem avaliação de onde os arquivos são renderizados, indexados e armazenados; “local” não equivale automaticamente a conformidade com a LGPD.

Também é preciso separar o modelo de recuperação da aplicação final. Ele encontra evidências; não garante que um LLM responda corretamente, cite a página certa ou respeite permissões. Um sistema corporativo precisa de controle de acesso antes da recuperação, isolamento por locatário, logs, testes contra documentos confidenciais e uma interface que mostre a fonte recuperada ao usuário.

Análise do NoticIA

O lançamento é mais interessante pela arquitetura de implantação do que por uma corrida de parâmetros. A compatibilidade entre 9B e 0,6B reconhece uma realidade operacional: qualidade de índice e velocidade de consulta são decisões diferentes. Isso pode reduzir o dilema comum entre um recuperador potente demais para a borda e um recuperador leve demais para um acervo complexo.

Mas o preço da expressividade é concreto. Multi-vetores ampliam armazenamento e tornam a busca de candidatos mais exigente; equipes pequenas podem obter mais retorno corrigindo chunking, metadados e avaliação de relevância antes de introduzir uma nova pilha de indexação. O caminho responsável é um piloto com dados representativos, métricas próprias e limites de custo definidos — não importar um checkpoint porque ele lidera um placar.

O que continua em aberto

A Perplexity não divulgou ainda o relatório técnico completo prometido, tampouco um endpoint de API para esses modelos. Portanto, disponibilidade de infraestrutura, desempenho em português, qualidade para documentos brasileiros e custo total de servir um índice multi-vetor precisam ser medidos por quem pretende adotar a tecnologia. Os pesos e instruções de uso já permitem essa verificação independente, mas não substituem uma prova de conceito controlada.



Descubra mais sobre noticiAI

Assine para receber nossas notícias mais recentes por e-mail.

R
Sobre o autorRedação Noticiai

Equipe editorial dedicada a explicar inteligência artificial com clareza, independência e contexto.