GUIA Técnico

Reescrita de consulta e recuperação multiconsulta

A reescrita de consultas e a recuperação de múltiplas consultas são técnicas RAG que transformam a pergunta do usuário antes da pesquisa, reformulando-a, dividindo-a em subperguntas ou gerando diversas variantes e mesclando seus resultados.

  • 3 minutos de leitura
  • Última atualização
Nesta página3 minutos de leitura
  1. Visão geral
  2. Mergulho profundo
  3. Impacto Estratégico
  4. O futuro da reescrita de consultas e da recuperação de múltiplas consultas
  5. Implementação no mundo real
  6. Riscos e guarda-corpos
  7. Roteiro de implementação
  8. Continue explorando
  9. Perguntas frequentes

Visão geral

Eles são importantes porque os usuários geralmente fazem perguntas vagas, conversacionais ou com várias partes cujo texto não corresponde aos documentos, e uma consulta melhor pode revelar passagens relevantes que uma única pesquisa literal deixaria passar.

Mergulho profundo

A qualidade da recuperação depende muito da consulta. Os usuários escrevem perguntas curtas, ambíguas ou coloquiais, enquanto os documentos usam seu próprio vocabulário. A transformação da consulta preenche essa lacuna antes que a pesquisa aconteça. A forma mais simples é reescrever: um LLM transforma a mensagem do usuário em uma consulta de pesquisa mais clara. Isso é essencial em chats multiturno, onde acompanhamentos como “e em 2023?” não significam nada sem histórico, então o sistema condensa a conversa em uma consulta independente. A decomposição divide uma questão complexa em subquestões que podem ser recuperadas separadamente, úteis para comparações ou questões multi-hop. A solicitação de retrocesso, descrita pelos pesquisadores Google DeepMind em 2023, faz primeiro uma pergunta mais geral para recuperar os princípios básicos. A recuperação multiconsulta gera diversas variantes da pergunta, executa uma pesquisa para cada uma e mescla os resultados. LangChain popularizou isso com seu MultiQueryRetriever. RAG-Fusion combina múltiplas consultas com fusão de classificação recíproca (RRF), um método descrito por Cormack, Clarke e Buettcher em 2009, que pontua cada documento somando 1/(k + classificação) nas listas de resultados. Os documentos que aparecem no topo de diversas listas chegam ao topo sem precisar de pontuações brutas comparáveis. Uma técnica relacionada, HyDE (Hypothetical Document Embeddings, Gao e colegas, 2022), faz com que o modelo escreva uma resposta hipotética e a incorpore em vez da pergunta, porque um texto em formato de resposta geralmente fica mais próximo de passagens de respostas reais no espaço de incorporação. Equívocos: mais consultas nem sempre são melhores. Cada variante adiciona latência e custo, e variantes mal geradas podem desviar-se da intenção do usuário, gerando documentos irrelevantes. A reescrita também pode eliminar restrições importantes, como datas ou nomes de produtos. Meça o recall e a qualidade das respostas em perguntas reais antes de adotar essas etapas.

Impacto Estratégico

Custo e orçamento

As decisões de arquitetura impulsionam o desempenho e os custos operacionais durante anos.

Decisões mais claras

A educação técnica ajuda as equipes a escolher a pilha certa, não apenas a mais nova.

Controle de qualidade

Melhores escolhas de engenharia reduzem incidentes de confiabilidade na produção.

O futuro da reescrita de consultas e da recuperação de múltiplas consultas

À medida que o RAG agente se espalha, a transformação da consulta é cada vez mais controlada pelo modelo que decide o que procurar, iterando quando os resultados parecem fracos, em vez de uma etapa fixa de reescrita. Isso torna as ideias subjacentes, a decomposição, as variantes e a fusão, mais importantes, mesmo que se tornem menos visíveis. As melhorias nos modelos de incorporação e na pesquisa híbrida reduzem algumas incompatibilidades de vocabulário, mas não eliminam a necessidade de esclarecer questões ambíguas ou de conversação. Espere que as equipes usem essas técnicas de forma seletiva, acionadas quando uma consulta parece complexa ou a recuperação inicial é fraca, para equilibrar qualidade e custo.

Implementação no mundo real

Em um assistente de chat, o acompanhamento “e para funcionários de meio período?” é reescrito em uma consulta independente, como "política de licença parental para funcionários de meio período", usando a conversa anterior.

Uma pergunta comparando os preços de dois provedores de nuvem é decomposta em pesquisas separadas para cada provedor, e os resultados são combinados antes de responder.

Um bot de suporte gera quatro frases de “meu aplicativo continua me desconectando”, incluindo termos técnicos como expiração de sessão e atualização de token, e funde os resultados com fusão de classificação recíproca.

Um assistente de pesquisa usa a solicitação de retrocesso para primeiro procurar o princípio geral por trás de uma questão restrita e, em seguida, recuperar detalhes específicos, fornecendo ao modelo tanto o histórico quanto os detalhes.

Riscos e guarda-corpos

  • A otimização de um benchmark pode ocultar fraquezas mais amplas do sistema.

  • Os custos de infraestrutura e manutenção são frequentemente subestimados.

  • As lacunas de segurança e observabilidade podem aumentar à medida que os sistemas se tornam mais complexos.

Roteiro de implementação

  1. Defina metas de latência, qualidade e custo antes da implementação.

  2. Benchmark sob condições realistas de carga e dados.

  3. Monitoramento de instrumentos para erros, desvios e impacto no usuário.

  4. Prepare caminhos de reversão e resposta a incidentes antes de escalar.

Continue explorando

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Query Rewriting and Multi-Query Retrieval quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Iniciar teste

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Perguntas frequentes

O que é reescrita de consulta e recuperação multiconsulta?

A reescrita de consultas e a recuperação de múltiplas consultas são técnicas RAG que transformam a pergunta do usuário antes da pesquisa, reformulando-a, dividindo-a em subperguntas ou gerando diversas variantes e mesclando seus resultados. Eles são importantes porque os usuários geralmente fazem perguntas vagas, conversacionais ou com várias partes cujo texto não corresponde aos documentos, e uma consulta melhor pode revelar passagens relevantes que uma única pesquisa literal deixaria passar.

Por que a reescrita de consultas é especialmente importante no bate-papo multiturno?

Uma continuação como “e em 2023?” precisa do histórico de conversas para se tornar uma consulta independente útil.

Qual técnica divide uma pergunta de comparação em pesquisas separadas para cada item que está sendo comparado?

A decomposição divide questões complexas ou com várias partes em subquestões recuperadas separadamente.

O que a solicitação de retrocesso faz?

A solicitação de retrocesso, dos pesquisadores Google DeepMind, recupera o histórico geral antes dos detalhes.

Na fusão recíproca de classificações, como é calculada a pontuação de um documento?

O RRF soma 1/(k + classificação) em cada lista que contém o documento, recompensando os documentos com classificação elevada em várias listas.

Por que o RRF é conveniente para mesclar a pesquisa vetorial e os resultados do BM25?

Como o RRF utiliza apenas posições de classificação, ele pode combinar listas cujas pontuações brutas não são comparáveis.