Busca Híbrida e Reranking: por que o seu RAG erra antes de o modelo escrever a primeira palavra
Movimento.ai
Quando um assistente corporativo responde algo errado sobre uma política interna ou um contrato, a reação instintiva é culpar o modelo de linguagem. Na prática, em boa parte dos sistemas de RAG (Retrieval-Augmented Generation) o erro nasce uma etapa antes: o modelo recebeu os trechos errados e, com toda a fluência do mundo, construiu uma resposta sólida em cima de uma base frágil. Se o seu projeto de IA responde bem em demonstrações e mal na operação real, vale olhar primeiro para a recuperação.
Por que só embeddings não bastam
A abordagem mais comum de RAG usa busca vetorial: o texto é convertido em embeddings, representações numéricas do significado, e a pergunta do usuário é comparada com os trechos da base por proximidade semântica. Isso funciona muito bem para perguntas conceituais, como "quais são as regras de reembolso de viagem?", mesmo quando o documento usa palavras diferentes.
O problema aparece em consultas que dependem de termos exatos: o número de uma cláusula, o código de um produto, o nome de uma norma, uma sigla interna, um CNPJ. Embeddings tendem a "suavizar" esses identificadores, e o trecho certo pode ficar fora dos primeiros resultados. Já a busca lexical clássica, como o BM25, que ranqueia por correspondência de palavras, resolve bem esses casos, mas falha quando o usuário descreve a ideia com outras palavras. Uma não substitui a outra: elas erram em lugares diferentes.
Busca híbrida: combinar dois jeitos de procurar
A busca híbrida executa as duas abordagens em paralelo e funde os resultados em uma única lista. Uma técnica comum de fusão é a Reciprocal Rank Fusion (RRF), que considera a posição de cada trecho em cada ranking, sem precisar comparar pontuações de escalas diferentes. Trechos que aparecem bem colocados nas duas listas sobem; os que só uma das buscas encontrou continuam na disputa.
O ganho é de cobertura: a etapa híbrida existe para garantir que o trecho certo esteja entre os candidatos, mesmo que não esteja em primeiro lugar. Ela é barata, rápida e já vem disponível em boa parte dos bancos vetoriais e motores de busca do mercado.
Reranking: o segundo olhar que dá precisão
Depois da busca híbrida, a lista ainda tem dezenas de candidatos de qualidade desigual. O reranker é um modelo menor e especializado, em geral um cross-encoder, que lê a pergunta e cada trecho juntos e atribui uma nota de relevância. É mais caro por item do que a busca inicial, e por isso só é aplicado ao conjunto reduzido de candidatos, e não à base inteira.
A lógica é de funil: a primeira etapa prioriza não perder o trecho certo; a segunda prioriza colocá-lo no topo. Entregar ao modelo de linguagem cinco trechos bem escolhidos, em vez de vinte misturados, reduz ruído, custo de tokens e a chance de o modelo se apoiar em um trecho irrelevante. Em avaliações públicas de recuperação, combinar busca híbrida e reranking costuma superar cada técnica isolada, embora o ganho varie conforme o tipo de documento e deva ser medido na sua própria base.
O que cobrar do time técnico
Para quem decide estratégia, três perguntas ajudam a separar um RAG de demonstração de um RAG de produção:
- Vocês medem a recuperação separadamente da resposta? Métricas como recall@k e NDCG, avaliadas sobre um conjunto de perguntas reais com os trechos corretos já mapeados, mostram se o problema está na busca ou na geração.
- A busca lida com identificadores e siglas da nossa empresa? Teste com códigos, números de contrato e termos internos, que é onde a busca puramente vetorial mais falha.
- Qual o orçamento de latência e custo do reranking? A etapa adiciona milissegundos e custo por consulta; o time deve saber quantos candidatos reordenar e qual o impacto na experiência.
Investir em recuperação costuma render mais do que trocar de modelo. Antes de comprar a próxima versão do modelo de linguagem, confirme que ele está recebendo os documentos certos. Na movimento.ai, apoiamos executivos a estruturar essas decisões com base no roadmap de IA e conectamos especialistas à sua operação — conheça nossa consultoria em implementação de IA e o serviço de alocação de profissionais em IA.
Consultoria brasileira especializada em implementação, treinamento e mentoria em IA para empresas. Conheça a movimento.ai
