GUIA de IA de linguagem

Atenção Cruzada

Atenção cruzada é o mecanismo que permite que uma sequência olhe para outra: um decodificador que gera texto pode atender à representação da entrada por um codificador.

2 minutos de leituraÚltima atualização

Visão geral

It is how models connect what they are producing to what they read, powering translation, captioning, and modern multimodal systems.

Mergulho profundo

A autoatenção permite que os tokens dentro de uma sequência se relacionem; a atenção cruzada permite que uma sequência extraia informações de uma sequência diferente. Em um decodificador Transformer, cada etapa de geração forma consultas a partir da saída parcialmente gerada, enquanto as chaves e os valores vêm das saídas do codificador. O modelo calcula a relevância de cada elemento de entrada para a posição atual de saída e extrai uma combinação ponderada de informações de entrada. Isso é o que permite que um decodificador de tradução se concentre nas palavras-fonte corretas à medida que escreve cada palavra-alvo. Além do texto, a atenção cruzada é a cola nos modelos multimodais: um decodificador de texto pode atender aos recursos de correção de imagens, ou um modelo de áudio pode alinhar o som às palavras transcritas. Sempre que dois fluxos distintos de informação precisam ser fundidos, a atenção cruzada geralmente é o tecido conjuntivo.

Visão Técnica

Mecanicamente, a atenção cruzada reutiliza a mesma fórmula de produto escalar da autoatenção, com uma diferença: as consultas vêm de uma sequência (o decodificador) e as chaves/valores vêm de outra (o codificador). Ele calcula os pesos de atenção como um softmax sobre a similaridade da chave de consulta e, em seguida, retorna uma soma ponderada de valores. Como as consultas e chaves se originam de fontes diferentes, as duas sequências podem diferir totalmente em comprimento, modalidade ou idioma.

Impacto Estratégico

Velocidade e escala

Os fluxos de trabalho de idiomas podem avançar mais rapidamente sem sacrificar a consistência.

Acesso e alcance

Ele expande o acesso entre idiomas e estilos de comunicação.

Decisões mais claras

As equipes podem gastar mais tempo julgando enquanto a automação cuida da repetição.

O futuro da atenção cruzada

A atenção cruzada é cada vez mais a interface padrão para unir modalidades. Os modelos de linguagem visual utilizam-no para que o texto possa se basear em regiões de imagem; geradores de imagens de difusão usam-no para condicionar pixels em prompts de texto. A pesquisa está buscando uma atenção cruzada mais eficiente (variantes lineares e esparsas) para lidar com documentos longos, imagens de alta resolução e vídeos. À medida que os sistemas de IA integram mais sentidos, espera-se que as camadas de atenção cruzada atuem como conectores universais, alinhando texto, som, visão e dados estruturados.

Implementação no mundo real

Na tradução automática neural, o decodificador atende às palavras de origem para escolher a tradução correta para cada palavra de saída.

A Difusão Estável usa atenção cruzada para condicionar cada região da imagem gerada no prompt de texto.

Modelos de linguagem de visão como Flamingo permitem que tokens de texto atendam recursos de imagem para respostas visuais a perguntas.

Os decodificadores de fala para texto atendem de forma cruzada aos quadros de áudio codificados para alinhar os sons com as palavras que estão sendo transcritas.

Riscos e guarda-corpos

Fatos alucinados podem entrar silenciosamente em relatórios, fluxos de apoio ou resultados de pesquisas.

A sensibilidade do prompt pode criar resultados inconsistentes em solicitações semelhantes.

Dados de texto confidenciais podem ser expostos se os controles de acesso forem fracos.

Roteiro de implementação

1

Defina o formato de saída, o tom e os padrões de qualidade antes da implementação.

2

Respostas terrestres com fontes confiáveis ​​sempre que a precisão for importante.

3

Mantenha um ponto de verificação de revisão humana para resultados de alto risco.

4

Rastreie padrões de falha e treine novamente prompts ou fluxos de trabalho regularmente.

Continue explorando

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Cross-Attention quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Iniciar teste

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Próximo guia

Edição de atenção cruzada prompt a prompt

Perguntas frequentes

What is Cross-Attention?

Atenção cruzada é o mecanismo que permite que uma sequência olhe para outra: um decodificador que gera texto pode atender à representação da entrada por um codificador. É como os modelos conectam o que estão produzindo com o que leem, potencializando a tradução, a legendagem e os sistemas multimodais modernos.

Qual é a principal diferença entre autoatenção e atenção cruzada?

A atenção cruzada atrai consultas de uma sequência (por exemplo, o decodificador) e chaves e valores de uma sequência diferente (por exemplo, o codificador), permitindo que os dois interajam.

Em um Transformer codificador-decodificador, de onde vêm as consultas de atenção cruzada?

O decodificador forma consultas a partir de sua saída parcialmente gerada e, em seguida, usa as saídas do codificador como chaves e valores para obter informações de entrada relevantes.

Por que as duas sequências de atenção cruzada podem ter durações ou modalidades diferentes?

Como as consultas se originam de uma fonte e as chaves/valores de outra, as sequências são independentes e podem diferir em comprimento, idioma ou modalidade.

Como a Difusão Estável usa atenção cruzada?

A atenção cruzada permite que cada parte da imagem gerada atenda ao prompt do texto, fundamentando o visual nas palavras.

Que operação matemática a atenção cruzada compartilha com a autoatenção?

Ambos usam a mesma atenção de produto escalar: pontuações de similaridade entre consultas e chaves, um softmax e, em seguida, uma soma ponderada de valores.