GUIA de IA de linguagem

Auto-RAG e recuperação reflexiva

Self-RAG é uma estrutura onde um modelo de linguagem decide quando recuperar e, em seguida, critica as passagens recuperadas e sua própria saída usando tokens de reflexão especiais.

2 minutos de leituraÚltima atualização

Visão geral

It matters because it makes retrieval-augmented generation adaptive and self-checking instead of blindly fetching documents for every query.

Mergulho profundo

O RAG padrão recupera um número fixo de passagens para cada entrada, mesmo quando nenhuma é necessária, e nunca verifica se a resposta é realmente suportada. O Self-RAG, introduzido por Asai e colegas em 2023, treina um único modelo para fazer três coisas sob demanda. Primeiro, ele emite um token de “recuperação” que decide se o conhecimento externo é necessário. Em segundo lugar, após a recuperação, ele emite tokens de crítica 'IsRelevant', julgando se cada passagem ajuda. Terceiro, gera tokens 'IsSupported' e 'IsUseful' avaliando se as suas próprias declarações são fundamentadas em evidências e quão boa é a resposta. Esses tokens de reflexão permitem que o sistema recupere apenas quando necessário, filtre passagens irrelevantes e prefira resultados que o próprio modelo classifique como bem suportados, reduzindo a alucinação.

Visão Técnica

O Self-RAG é treinado por meio de aprendizado supervisionado em dados rotulados com tokens de reflexão, geralmente destilados de um modelo mais forte como o GPT-4. Na inferência, o modelo intercala tokens de texto comuns com esses tokens de controle especiais. Uma pesquisa de feixe em nível de segmento pode então pontuar continuações de candidatos usando as probabilidades dos tokens de crítica, permitindo que os desenvolvedores ajustem o comportamento em tempo de execução - por exemplo, ponderando 'IsSupported' mais pesadamente para maximizar o fundamento factual versus fluência.

Impacto Estratégico

Velocidade e escala

Os fluxos de trabalho de idiomas podem avançar mais rapidamente sem sacrificar a consistência.

Acesso e alcance

Ele expande o acesso entre idiomas e estilos de comunicação.

Decisões mais claras

As equipes podem gastar mais tempo julgando enquanto a automação cuida da repetição.

O futuro do auto-RAG e da recuperação reflexiva

A recuperação reflexiva está convergindo com o RAG de agência, onde os modelos planejam pesquisas em várias etapas, chamam ferramentas e se autocorrigem entre iterações. Espere uma integração mais estreita da autocrítica com modelos de verificação, recuperação em gráficos de conhecimento e aprendizagem por reforço que recompense respostas fiéis e bem citadas. À medida que os modelos de raciocínio amadurecem, a recuperação sob demanda e autoavaliada provavelmente se tornará um comportamento padrão, em vez de uma estrutura separada, com o modelo decidindo dinamicamente quanta evidência cada afirmação requer.

Implementação no mundo real

Um assistente médico de perguntas e respostas recupera diretrizes apenas para questões clínicas e ignora a recuperação de saudações, usando seu token de decisão 'recuperar'.

Um assistente de pesquisa filtra resultados de pesquisa fora do tópico, verificando a crítica 'IsRelevant' de cada passagem antes de escrever.

Um chatbot corporativo prefere respostas marcadas como 'IsSupported' para que suas declarações permaneçam fundamentadas em documentos da empresa, evitando alucinações.

Uma ferramenta de verificação de fatos usa a pontuação 'IsUseful' para classificar as respostas de vários candidatos e revelar a mais bem evidenciada.

Riscos e guarda-corpos

Fatos alucinados podem entrar silenciosamente em relatórios, fluxos de apoio ou resultados de pesquisas.

A sensibilidade do prompt pode criar resultados inconsistentes em solicitações semelhantes.

Dados de texto confidenciais podem ser expostos se os controles de acesso forem fracos.

Roteiro de implementação

1

Defina o formato de saída, o tom e os padrões de qualidade antes da implementação.

2

Respostas terrestres com fontes confiáveis ​​sempre que a precisão for importante.

3

Mantenha um ponto de verificação de revisão humana para resultados de alto risco.

4

Rastreie padrões de falha e treine novamente prompts ou fluxos de trabalho regularmente.

Continue explorando

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Self-RAG and Reflective Retrieval quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Iniciar teste

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Próximo guia

RAG especulativo e desenho aumentado de recuperação

Perguntas frequentes

What is Self-RAG and Reflective Retrieval?

Self-RAG é uma estrutura onde um modelo de linguagem decide quando recuperar e, em seguida, critica as passagens recuperadas e sua própria saída usando tokens de reflexão especiais. É importante porque torna a geração de recuperação aumentada adaptável e autoverificável, em vez de buscar documentos cegamente para cada consulta.

Que decisão principal o Self-RAG toma que o RAG padrão não toma?

O Self-RAG emite um token de 'recuperação' para decidir sob demanda se documentos externos são necessários, em vez de sempre recuperá-los.

O que são 'tokens de reflexão' no Self-RAG?

Tokens de reflexão como IsRelevant, IsSupported e IsUseful permitem que o modelo critique passagens e sua própria saída.

Qual token de reflexão avalia se uma declaração gerada está fundamentada nas evidências recuperadas?

O token IsSupported avalia se a afirmação do modelo é realmente apoiada pelas passagens recuperadas, ajudando a reduzir a alucinação.

Como um modelo Self-RAG é normalmente treinado para produzir tokens de reflexão?

O Self-RAG aprende com dados de treinamento anotados com tokens de reflexão, frequentemente gerados por um modelo de professor mais capaz, como o GPT-4.

Que vantagem oferece a emissão de uma crítica 'IsRelevant' para cada passagem?

Ao criticar a relevância de cada passagem, o Self-RAG pode ignorar recuperações fora do tópico em vez de incluí-las na resposta.