A seguirPróximo guia
Atenção multiconsulta
IA de linguagem
GUIA Técnico
A reescrita de consultas e a recuperação de múltiplas consultas são técnicas RAG que transformam a pergunta do usuário antes da pesquisa, reformulando-a, dividindo-a em subperguntas ou gerando diversas variantes e mesclando seus resultados.
Eles são importantes porque os usuários geralmente fazem perguntas vagas, conversacionais ou com várias partes cujo texto não corresponde aos documentos, e uma consulta melhor pode revelar passagens relevantes que uma única pesquisa literal deixaria passar.
A qualidade da recuperação depende muito da consulta. Os usuários escrevem perguntas curtas, ambíguas ou coloquiais, enquanto os documentos usam seu próprio vocabulário. A transformação da consulta preenche essa lacuna antes que a pesquisa aconteça. A forma mais simples é reescrever: um LLM transforma a mensagem do usuário em uma consulta de pesquisa mais clara. Isso é essencial em chats multiturno, onde acompanhamentos como “e em 2023?” não significam nada sem histórico, então o sistema condensa a conversa em uma consulta independente. A decomposição divide uma questão complexa em subquestões que podem ser recuperadas separadamente, úteis para comparações ou questões multi-hop. A solicitação de retrocesso, descrita pelos pesquisadores Google DeepMind em 2023, faz primeiro uma pergunta mais geral para recuperar os princípios básicos. A recuperação multiconsulta gera diversas variantes da pergunta, executa uma pesquisa para cada uma e mescla os resultados. LangChain popularizou isso com seu MultiQueryRetriever. RAG-Fusion combina múltiplas consultas com fusão de classificação recíproca (RRF), um método descrito por Cormack, Clarke e Buettcher em 2009, que pontua cada documento somando 1/(k + classificação) nas listas de resultados. Os documentos que aparecem no topo de diversas listas chegam ao topo sem precisar de pontuações brutas comparáveis. Uma técnica relacionada, HyDE (Hypothetical Document Embeddings, Gao e colegas, 2022), faz com que o modelo escreva uma resposta hipotética e a incorpore em vez da pergunta, porque um texto em formato de resposta geralmente fica mais próximo de passagens de respostas reais no espaço de incorporação. Equívocos: mais consultas nem sempre são melhores. Cada variante adiciona latência e custo, e variantes mal geradas podem desviar-se da intenção do usuário, gerando documentos irrelevantes. A reescrita também pode eliminar restrições importantes, como datas ou nomes de produtos. Meça o recall e a qualidade das respostas em perguntas reais antes de adotar essas etapas.
As decisões de arquitetura impulsionam o desempenho e os custos operacionais durante anos.
A educação técnica ajuda as equipes a escolher a pilha certa, não apenas a mais nova.
Melhores escolhas de engenharia reduzem incidentes de confiabilidade na produção.
À medida que o RAG agente se espalha, a transformação da consulta é cada vez mais controlada pelo modelo que decide o que procurar, iterando quando os resultados parecem fracos, em vez de uma etapa fixa de reescrita. Isso torna as ideias subjacentes, a decomposição, as variantes e a fusão, mais importantes, mesmo que se tornem menos visíveis. As melhorias nos modelos de incorporação e na pesquisa híbrida reduzem algumas incompatibilidades de vocabulário, mas não eliminam a necessidade de esclarecer questões ambíguas ou de conversação. Espere que as equipes usem essas técnicas de forma seletiva, acionadas quando uma consulta parece complexa ou a recuperação inicial é fraca, para equilibrar qualidade e custo.
Em um assistente de chat, o acompanhamento “e para funcionários de meio período?” é reescrito em uma consulta independente, como "política de licença parental para funcionários de meio período", usando a conversa anterior.
Uma pergunta comparando os preços de dois provedores de nuvem é decomposta em pesquisas separadas para cada provedor, e os resultados são combinados antes de responder.
Um bot de suporte gera quatro frases de “meu aplicativo continua me desconectando”, incluindo termos técnicos como expiração de sessão e atualização de token, e funde os resultados com fusão de classificação recíproca.
Um assistente de pesquisa usa a solicitação de retrocesso para primeiro procurar o princípio geral por trás de uma questão restrita e, em seguida, recuperar detalhes específicos, fornecendo ao modelo tanto o histórico quanto os detalhes.
A otimização de um benchmark pode ocultar fraquezas mais amplas do sistema.
Os custos de infraestrutura e manutenção são frequentemente subestimados.
As lacunas de segurança e observabilidade podem aumentar à medida que os sistemas se tornam mais complexos.
Defina metas de latência, qualidade e custo antes da implementação.
Benchmark sob condições realistas de carga e dados.
Monitoramento de instrumentos para erros, desvios e impacto no usuário.
Prepare caminhos de reversão e resposta a incidentes antes de escalar.
Free newsletter
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
A reescrita de consultas e a recuperação de múltiplas consultas são técnicas RAG que transformam a pergunta do usuário antes da pesquisa, reformulando-a, dividindo-a em subperguntas ou gerando diversas variantes e mesclando seus resultados. Eles são importantes porque os usuários geralmente fazem perguntas vagas, conversacionais ou com várias partes cujo texto não corresponde aos documentos, e uma consulta melhor pode revelar passagens relevantes que uma única pesquisa literal deixaria passar.
Uma continuação como “e em 2023?” precisa do histórico de conversas para se tornar uma consulta independente útil.
A decomposição divide questões complexas ou com várias partes em subquestões recuperadas separadamente.
A solicitação de retrocesso, dos pesquisadores Google DeepMind, recupera o histórico geral antes dos detalhes.
O RRF soma 1/(k + classificação) em cada lista que contém o documento, recompensando os documentos com classificação elevada em várias listas.
Como o RRF utiliza apenas posições de classificação, ele pode combinar listas cujas pontuações brutas não são comparáveis.
Continue aprendendo
Mais guias escolhidos para este tópico
A seguirPróximo guia
Atenção multiconsulta
IA de linguagem