Arquitetura de IA

Modelo de embeddings para RAG: como escolher

Saiba como escolher um modelo de embeddings para RAG em português, testar recuperação, comparar custos e migrar o índice sem misturar espaços vetoriais.

O modelo que responde pode estar recebendo a fonte errada

Uma equipe de suporte usa um agente para consultar manuais. Quando o cliente descreve o defeito com palavras informais, a busca entrega documentos do mesmo assunto, mas deixa de fora o procedimento necessário. Trocar o modelo que escreve a resposta pouco ajuda se a evidência continua ausente.

O modelo de embeddings converte textos em representações numéricas usadas na busca por similaridade. Ele influencia quais trechos entram no conjunto de candidatos de um sistema de RAG. Sua escolha deve considerar o idioma, o tipo de pergunta, os documentos e o custo de manter o índice atualizado.

A decisão termina em um perfil de representação testado: modelo, revisão, preparação da entrada, dimensão, métrica e procedimento de atualização. Escolher apenas um nome de fornecedor deixa parte importante da configuração sem controle.

Embedding, banco vetorial e modelo gerador têm funções diferentes

O embedding representa a pergunta e o conteúdo. O banco armazena vetores e executa a busca. O gerador recebe evidências e produz a resposta. Uma falha em qualquer etapa pode aparecer ao usuário como uma resposta ruim, embora exija correções diferentes.

Antes de comparar modelos, observe uma pergunta que falhou:

  • o documento correto existe e está autorizado?
  • a extração preservou seu conteúdo?
  • o trecho conserva a informação necessária?
  • a representação aproxima a pergunta desse trecho?
  • o índice recupera o candidato com a configuração atual?
  • o candidato chega ao contexto final?

O guia de banco vetorial para IA trata da camada de armazenamento e consulta. Aqui, o objeto da escolha é a representação produzida antes dessa consulta.

Escolha pelo tipo de recuperação

Pergunta curta procurando um trecho longo

É o cenário frequente de atendimento: uma frase do cliente precisa localizar um parágrafo de manual. Pergunta e resposta possuem formatos e funções diferentes.

A documentação de busca semântica do Sentence Transformers distingue busca simétrica e assimétrica. Na assimétrica, uma consulta curta procura uma passagem maior que a responde. A escolha do modelo deve refletir essa tarefa.

Alguns modelos exigem instruções ou caminhos específicos para representar consultas e documentos. Use o contrato documentado do modelo. Aplicar a mesma preparação aos dois lados por conveniência pode contrariar a forma como ele foi treinado.

Texto procurando outro texto semelhante

Encontrar chamados duplicados ou perguntas equivalentes se aproxima de uma busca simétrica. Um modelo bom nessa tarefa pode não ser o melhor para localizar uma resposta em um manual extenso.

Pergunta em português procurando fonte em outro idioma

Suporte técnico pode receber uma pergunta em português enquanto a fonte está em inglês. Inclua esse caso no teste. A etiqueta “multilíngue” não demonstra qualidade em siglas, vocabulário da empresa, abreviações e nomes de peças.

Avalie também perguntas inteiramente em português. Um benchmark global não substitui a linguagem que o cliente efetivamente usa.

Monte um conjunto de escolha antes de indexar tudo

Selecione documentos autorizados que representem o primeiro processo. Uma pessoa da área deve marcar as passagens que sustentam cada resposta e identificar perguntas sem evidência disponível.

Inclua grupos que exponham falhas diferentes:

  • paráfrases e linguagem informal;
  • termos técnicos e abreviações;
  • documentos parecidos com condições diferentes;
  • negações que alteram a regra;
  • consulta curta e consulta com detalhes;
  • português com termos estrangeiros;
  • código exato acompanhado de descrição;
  • pergunta fora do escopo da base.

Separe perguntas usadas no ajuste daquelas reservadas para validação. Preserve a versão dos documentos. O dataset de avaliação para agentes ajuda a organizar esse controle.

Identificadores e permissões não deveriam depender de proximidade semântica. Mantenha campos exatos e filtros de acesso. O embedding pode ajudar a encontrar um procedimento; não deve decidir a identidade do cliente nem autorizar uma consulta.

Compare modelos sem alterar toda a arquitetura

Use a configuração atual como linha de base e teste alternativas com os mesmos documentos, trechos, filtros e perguntas. Se cada modelo exige uma preparação própria, registre essa diferença como parte do perfil avaliado.

Primeiro isole a qualidade da representação. Quando viável, compare a recuperação exata dos vetores no conjunto de teste. Depois valide a configuração de busca aproximada usada em produção. Isso ajuda a separar perda causada pelo modelo de perda causada pelos parâmetros do índice.

Não altere chunking, modelo de resposta e ranking ao mesmo tempo. Se o corte separou uma regra de sua exceção, resolva isso no chunking de documentos para RAG antes de atribuir tudo ao embedding.

Meça a presença das passagens relevantes entre os candidatos recuperados, com um limite de candidatos igual em cada comparação. Observe também a posição da evidência, os erros por classe de pergunta, o tempo de consulta e o custo para gerar e atualizar os vetores.

Uma melhora média pode esconder regressão no vocabulário mais importante para o suporte. Apresente exemplos de ganhos e perdas ao responsável do processo, especialmente onde uma fonte errada induziria uma orientação inadequada.

Dimensão maior não decide a compra

A dimensão indica quantos componentes formam cada vetor. Ela afeta armazenamento e processamento, mas não funciona como uma nota universal de qualidade.

Escolha dimensão, normalização e métrica conforme o modelo e o banco suportam. Redução de dimensão precisa ser explicitamente compatível e testada; cortar componentes de qualquer vetor de forma arbitrária pode degradar o resultado.

O limite de entrada também merece inspeção. Se o componente trunca um trecho, registre onde isso ocorre. O documento pode estar completo no armazenamento enquanto sua representação considera apenas parte dele. A avaliação precisa detectar esse desencontro.

Dois vetores com a mesma dimensão não são necessariamente comparáveis. Modelos diferentes podem representar significado em espaços incompatíveis. A consulta deve usar a representação compatível com a indexação daquele acervo.

API ou execução local

Uma API pode reduzir trabalho de infraestrutura. A avaliação deve cobrir condições de tratamento dos documentos, limites de uso, disponibilidade, revisão do modelo e custo de reindexação.

Execução local pode atender requisitos de implantação e controle, mas transfere à equipe a responsabilidade por capacidade, atualização, segurança e reprodução do ambiente. Verifique licença e adequação comercial do modelo específico.

Nos dois casos, o texto enviado para gerar embeddings continua sendo dado empresarial. O vetor derivado também exige governança; sua aparência numérica não comprova anonimização. Preserve classificação, origem e capacidade de exclusão.

A comparação econômica deve incluir indexação inicial, mudanças recorrentes, consultas, armazenamento, infraestrutura e horas de correção. Um modelo barato que deixa a equipe procurar manualmente a fonte em toda resposta pode sair caro na unidade de trabalho.

Como trocar o modelo sem misturar o índice

A migração deve preservar duas configurações identificáveis até o aceite:

  1. registre o perfil atual e um conjunto de perguntas de regressão;
  2. gere os novos vetores em índice ou campo separado;
  3. vincule cada vetor ao documento, trecho, versão e perfil de representação;
  4. configure cada consulta para usar o modelo compatível com seu índice;
  5. compare as duas recuperações sem alterar a resposta entregue ao usuário;
  6. sincronize atualizações e exclusões que ocorreram durante a comparação;
  7. libere o novo perfil gradualmente, com rota de retorno testada;
  8. encerre a versão anterior conforme a política de retenção.

Evite consultar vetores antigos com o modelo novo. Um sistema pode aceitar a dimensão e retornar resultados sem que a comparação tenha validade semântica.

O retorno ao índice anterior também exige verificar acesso e vigência. Se uma política foi revogada ou um documento excluído, a reversão não pode recolocá-lo em circulação.

Quando a escolha está suficientemente comprovada

Aprovar o perfil exige recuperação adequada nas perguntas do processo, ausência de regressões críticas, custo sustentável e manutenção reproduzível. Guarde os casos que decidiram a escolha, não somente uma nota final.

Se a evidência entra na lista, mas fica mal posicionada, investigue reranking para RAG. Se a dificuldade está em combinar linguagem informal com códigos e termos exatos, avalie busca híbrida.

Essa separação permite investir na etapa que está falhando. O resultado esperado é a equipe encontrar a evidência necessária com menos busca manual e sem perder controle sobre a origem do que recebe.