Arquitetura de IA

Reranking para RAG: quando usar e como avaliar

Veja como avaliar reranking para RAG, escolher candidatos, preservar exceções e comparar relevância, custo e latência antes de incluir a etapa na produção.

A passagem correta aparece, mas não chega à resposta

Um analista pergunta qual condição permite antecipar o encerramento de um serviço. A busca encontra a cláusula relevante, porém coloca vários trechos genéricos sobre cancelamento antes dela. O sistema envia apenas os primeiros resultados ao modelo. A resposta perde justamente a condição necessária.

Reranking é a reclassificação de candidatos já recuperados. Uma etapa adicional avalia a relação entre a pergunta e cada passagem, ou entre a pergunta e o conjunto, para melhorar a ordem final.

Esse mecanismo merece teste quando a evidência existe na lista inicial e está mal posicionada. Se o documento nunca foi recuperado, o investimento precisa começar em outra etapa. Um reclassificador não avalia uma passagem que não recebeu.

O que muda em relação à busca e à fusão

A recuperação inicial procura candidatos em uma coleção ampla. Ela precisa equilibrar cobertura e velocidade. Uma busca híbrida pode combinar candidatos textuais e vetoriais, fundindo suas posições em uma lista única.

O reranking recebe uma lista menor e faz uma avaliação adicional de relevância. Seu objeto é a ordem dos candidatos disponíveis, não a construção do índice nem a combinação inicial de mecanismos de busca.

A documentação de Retrieve & Re-Rank do Sentence Transformers apresenta essa arquitetura em duas etapas: recuperar candidatos e reclassificá-los com um cross-encoder. O exemplo demonstra um desenho possível, sem estabelecer o ganho que uma empresa terá nos próprios documentos.

O guia de busca híbrida para RAG explica a recuperação e a fusão. Para decidir pela reclassificação, é preciso aprofundar o teste de ordenação, o contrato de entrada e o comportamento quando o componente falha.

Primeiro confirme o tipo de erro

Pegue perguntas que exigiram correção humana e reconstrua a trajetória da evidência.

A passagem necessária não aparece

Investigue extração, indexação, filtros, vocabulário, divisão dos documentos e representação da consulta. O guia de modelo de embeddings para RAG trata da escolha da representação semântica.

Ampliar candidatos pode ser uma hipótese, mas deve preservar acesso, custo e prazo. Não recupere conteúdo de outros clientes para aumentar artificialmente a cobertura.

A passagem aparece e perde posição

Esse é o caso mais favorável ao teste de reranking. Compare a ordem original com a ordem reclassificada usando os mesmos candidatos.

A passagem está bem posicionada e a resposta erra

Observe a seleção de contexto e a geração. O sistema pode truncar a fonte, perder uma exceção ou interpretar incorretamente o texto recebido. Reordenar resultados já adequados adiciona trabalho sem atacar a causa.

Essa triagem evita contratar uma etapa de busca para corrigir uma falha de interpretação ou de conteúdo.

Cross-encoder ou reclassificação com LLM

Cross-encoder

Um cross-encoder avalia pergunta e passagem em conjunto e atribui um score de relevância. Diferentemente da recuperação vetorial baseada em representações pré-calculadas dos documentos, essa comparação requer processamento dos pares no momento da reclassificação.

É uma alternativa apropriada para testar ordenação de passagens. A escolha precisa considerar português, vocabulário especializado, limite de entrada e custo no volume de consultas esperado.

O score depende do modelo. Não presuma que ele seja comparável ao score da busca ou uma probabilidade de a resposta estar correta.

LLM como reclassificador

Um modelo generativo pode receber candidatos identificados e devolver uma ordem estruturada. Isso permite expressar critérios específicos, mas também cria riscos de saída inválida, omissão, repetição e instabilidade na ordenação.

Exija identificadores pertencentes à entrada, unicidade e estrutura validável. Uma justificativa bem escrita não compensa a troca silenciosa de um identificador. Quando o modelo avalia candidatos em grupos separados, não presuma que scores de grupos diferentes sejam diretamente comparáveis.

Teste sensibilidade à posição: embaralhe a lista mantendo seu conteúdo e observe se a preferência muda sem motivo substantivo. Limite tokens e tentativas. Não permita que uma falha de formato dispare uma sequência ilimitada de chamadas.

Defina o contrato dos candidatos

Cada candidato precisa chegar ao reclassificador com identidade estável e conteúdo suficiente para ser avaliado. Um contrato mínimo inclui:

  • identificador do trecho e do documento;
  • versão e vigência;
  • título ou caminho da seção;
  • texto da passagem;
  • vínculos com definições ou ressalvas necessárias;
  • posição original e origem da recuperação.

A autorização deve ser resolvida antes do envio. Um serviço externo de reranking também recebe documentos, portanto entra na avaliação de tratamento de dados, retenção e acesso.

Preserve a pergunta original e restrições confirmadas do caso. Se um identificador de produto exige igualdade, não peça ao reclassificador para decidir livremente se outro produto “parece suficientemente próximo”. A política de elegibilidade prevalece sobre relevância.

Conteúdo recuperado continua sendo entrada não confiável. Especialmente no uso de LLM, instruções dentro de documentos não devem alterar a tarefa de classificar nem acionar ferramentas. O controle de prompt injection em agentes também se aplica às etapas intermediárias.

Escolha a quantidade de candidatos por evidência

Existem dois limites distintos: quantos trechos entram no reranking e quantos seguem para o contexto final. O primeiro determina o universo que poderá ser reordenado. O segundo determina quanta evidência o gerador receberá.

Teste uma lista mais curta e outra mais ampla mantendo o restante fixo. Depois avalie a seleção final dentro do orçamento de contexto. Não use a quantidade máxima permitida pelo fornecedor como configuração padrão.

Inspecione truncamento em cada etapa. Um reranker pode avaliar apenas o início da passagem enquanto o gerador recebe o texto inteiro. Isso pode fazer a ordenação ignorar a ressalva que estava no fim.

A relação entre regra e exceção merece um tratamento explícito. Uma passagem genérica pode receber score alto por responder diretamente à pergunta, enquanto a ressalva parece menos relevante isoladamente. Preserve vínculos de dependência definidos na preparação documental; não espere que o ranking descubra todas essas relações.

O chunking para RAG organiza essas unidades. Reranking e seleção final precisam respeitar o contrato produzido ali.

Faça uma comparação que isole o ganho

Congele perguntas, versões das fontes, filtros e candidatos iniciais. Compare uma linha de base sem reranking com a configuração reclassificada. Mantenha também o mesmo orçamento final de contexto.

Uma pessoa do processo deve marcar relevância e suficiência da evidência. Algumas perguntas exigem uma passagem; outras exigem regra, exceção e definição. Avaliar somente o primeiro trecho favorece soluções que parecem precisas e entregam contexto incompleto.

Observe:

  • presença da evidência necessária no contexto final;
  • posição da primeira passagem útil;
  • qualidade da ordenação quando há graus diferentes de relevância;
  • preservação das dependências entre passagens;
  • diversidade de evidências sem duplicação excessiva;
  • fontes indevidas, vencidas ou incompatíveis;
  • tempo adicional e custo por consulta;
  • correções humanas após a resposta.

Métricas como MRR ajudam a observar a posição do primeiro resultado relevante. NDCG permite avaliar ordenação com graus de relevância. Nenhuma delas, sozinha, demonstra que o conjunto final contém tudo que uma decisão precisa. Relate também os casos incompletos e os erros críticos.

Projete a falha antes de liberar a etapa

O reclassificador pode ficar indisponível, exceder o prazo ou devolver resultados inválidos. Defina uma rota por tipo de tarefa.

Para uma busca exploratória interna, pode ser aceitável apresentar a ordem original com indicação do modo degradado. Para uma resposta que sustenta uma decisão sensível, talvez seja necessário suspender a geração e encaminhar o caso para revisão.

O fallback para o ranking original só é válido se essa configuração tiver sido aprovada para o uso correspondente. Não transforme a indisponibilidade do componente em permissão para reduzir silenciosamente a qualidade.

Rejeite identificadores inexistentes e candidatos duplicados. Registre a causa, a configuração executada e a rota adotada, minimizando a cópia de conteúdo sensível nos logs. O guia de fallback para agentes de IA detalha a governança dessas alternativas.

Critério de adoção e acompanhamento

Inclua reranking quando ele resolver uma falha demonstrada de ordenação, preservar evidência completa e caber no prazo e no custo da tarefa. Se o ganho aparecer apenas em perguntas usadas para ajustar a configuração, repita o teste com perguntas reservadas.

Depois da liberação, acompanhe alterações de documentos e padrões de consulta. Guarde casos em que a etapa promoveu uma fonte inadequada ou retirou uma passagem necessária. Eles devem alimentar a regressão antes de trocar modelo, limite ou instruções.

A entrega técnica é um perfil de reclassificação com contrato, avaliação e rota de falha. O ganho empresarial aparece quando menos respostas voltam para correção por terem usado evidências mal selecionadas.