Inteligência artificial, sem ruído.
Modelos e LLMs3 min

R²Adapter corta em 59% o uso de RAG com grafos sem perder precisão

Adaptador leve roteia consultas entre RAG simples e RAG com grafos, cortando até 59% do uso de grafos sem perder precisão de resposta.

R²Adapter corta em 59% o uso de RAG com grafos sem perder precisão

A geração aumentada por recuperação (RAG) virou o padrão para dar conhecimento externo aos grandes modelos de linguagem (LLMs). Mas há um dilema conhecido: o RAG “vanilla” é rápido e lida bem com perguntas simples, mas tropeça em raciocínio relacional e multi-etapas; já o RAG baseado em grafos resolve essas consultas complexas, porém cobra o preço em latência e complexidade de inferência. Um novo trabalho propõe uma saída elegante para não precisar escolher entre os dois.

Um adaptador que decide, em tempo real, qual caminho usar

O R²Adapter (Routing and Rewriting Adapter) é um plugin leve e independente de modelo que aloca cada consulta dinamicamente entre o RAG vanilla e o RAG baseado em grafos. A ideia central: rotear para o caminho caro apenas as consultas que realmente se beneficiam de raciocínio em grafo, em vez de mandar tudo para o mesmo lugar.

O adaptador atua em duas frentes. Primeiro, faz o roteamento: consultas simples vão direto para o RAG vanilla, sem gastar com recuperação em grafo desnecessária. Segundo, faz a reescrita: consultas roteadas para o grafo, mas que chegam ambíguas, são reescritas para expor melhor suas necessidades de raciocínio multi-etapas — melhorando a qualidade da recuperação sem supervisão adicional.

Resultados: menos computação, mesma precisão

Nos experimentos em três benchmarks de perguntas e respostas multi-hop, o R²Adapter reduziu o uso de RAG baseado em grafos em até 59%, mantendo a precisão de resposta comparável. Isso significa que a maior parte das consultas do dia a dia segue pelo caminho barato, enquanto apenas as realmente complexas acionam o raciocínio em grafo.

Diferente de métodos híbridos anteriores, que dependiam de heurísticas ou de um LLM para rotear (adicionando overhead e uma forte dependência do modelo subjacente), o R²Adapter é agnóstico de modelo e pode ser integrado de forma transparente em pipelines RAG diversos — tanto os vanilla quanto os baseados em grafos.

Por que isso importa para o Brasil

Para equipes brasileiras que constroem assistentes sobre bases de conhecimento, documentos corporativos ou dados regulatórios, o custo de inferência é um fator decisivo — especialmente quando a infraestrutura em nuvem é cotada em dólar. A capacidade de reduzir o uso de grafo em quase 60% sem perder qualidade é um ganho direto de latência e de fatura no fim do mês.

O estudo também aponta um princípio de design valioso: em sistemas de IA, a solução mais robusta nem sempre é aplicar a técnica mais sofisticada a todas as entradas. Muitas vezes, o que faz diferença é decidir bem quando usar a ferramenta certa — uma lição que vale para RAG e para praticamente qualquer pipeline de IA em produção.


Descubra mais sobre noticiAI

Assine para receber nossas notícias mais recentes por e-mail.

R
Sobre o autorRedação Noticiai

Equipe editorial dedicada a explicar inteligência artificial com clareza, independência e contexto.