GUIA visual de IA

Legendagem de imagens

A legendagem de imagens é a tarefa de gerar automaticamente uma frase em linguagem natural que descreve o que está em uma imagem.

2 minutos de leituraÚltima atualização

Visão geral

Ela une visão e linguagem, transformando pixels em palavras que explicam conteúdo, objetos e ações.

Mergulho profundo

Os sistemas de legendagem de imagens capturam uma imagem e produzem uma descrição fluente, como 'um cachorro marrom pegando um frisbee na grama'. Os primeiros sistemas emparelhavam uma rede convolucional que extraía características visuais com uma rede recorrente (uma LSTM) que gerava palavras uma de cada vez, muitas vezes guiada pela atenção para que o modelo “olhar” para regiões relevantes para cada palavra. Os sistemas modernos usam codificadores transformadores para visão e decodificadores transformadores para linguagem, e grandes modelos de linguagem visual como BLIP-2 e GPT-4V podem captar imagens com notável fluência. O treinamento depende de conjuntos de dados como o MS COCO, onde cada imagem possui várias legendas escritas por humanos. A qualidade é medida com métricas como CIDEr, BLEU e CLIPScore baseado em incorporação.

Visão Técnica

A maioria dos legendadores segue um padrão codificador-decodificador. O codificador converte a imagem em um conjunto de vetores de recursos; o decodificador gera palavras autoregressivamente, prevendo cada token condicionado à imagem e às palavras geradas anteriormente. A atenção permite que o decodificador pondere diferentes regiões da imagem por palavra, melhorando o aterramento. O treinamento usa entropia cruzada em legendas verdadeiras, às vezes seguida por aprendizado de reforço que otimiza uma métrica de qualidade de legenda como o CIDEr diretamente para reduzir o viés de exposição.

Impacto Estratégico

Velocidade e escala

A IA visual pode automatizar tarefas de inspeção, detecção e marcação em grande escala.

Escolhas de construção

As equipes criativas podem criar protótipos de conceitos mais rapidamente e com menos revisões manuais.

Equipe e fluxo de trabalho

As operações podem usar sinais de imagem e vídeo que antes eram difíceis de processar.

O futuro da legendagem de imagens

A legendagem é a fusão em modelos gerais de linguagem de visão que não apenas descrevem, mas também respondem a perguntas, raciocinam e seguem instruções sobre imagens. Espere legendas mais densas e controláveis ​​(comprimento, estilo ou foco ajustáveis), melhor base factual para conter objetos alucinados e ferramentas de acessibilidade mais fortes que narram o mundo visual em tempo real. As legendas multilíngues e de vídeo serão expandidas, e os modelos no dispositivo trarão descrições privadas e instantâneas para telefones e wearables para usuários cegos e com baixa visão.

Implementação no mundo real

Geração de descrições de fotos em texto alternativo para que leitores de tela possam ajudar usuários cegos e com baixa visão

Sugestão automática de legendas e tags pesquisáveis para grandes bibliotecas de fotos e plataformas de banco de imagens

Descrever o ambiente em voz alta por meio de aplicativos como Microsoft Seeing AI ou Be My Eyes

Indexação de quadros de vídeo com descrições de texto para permitir pesquisa e moderação de conteúdo em grande escala

Riscos e guarda-corpos

Os direitos de imagem e o consentimento podem tornar-se riscos legais se a proveniência não for clara.

O desempenho do modelo pode variar dependendo da iluminação, dados demográficos e ambientes.

Os falsos positivos podem passar despercebidos, a menos que os limites de confiança sejam monitorados.

Roteiro de implementação

1

Defina critérios de aceitação para precisão, recall e custos de erro.

2

Teste com dados que correspondam às condições reais de produção.

3

Adicione revisão humana para previsões de baixa confiança ou de alto impacto.

4

Rastreie o desvio do modelo e revalide após alterações na câmera ou no conjunto de dados.

Continue explorando

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Image Captioning quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Iniciar teste

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Perguntas frequentes

O que é legenda de imagem?

A legendagem de imagens é a tarefa de gerar automaticamente uma frase em linguagem natural que descreve o que está em uma imagem. Ele une visão e linguagem, transformando pixels em palavras que explicam conteúdo, objetos e ações.

O que um sistema de legendagem de imagens produz como saída?

A legendagem de imagens gera uma frase de texto que descreve o conteúdo de uma imagem.

Em um pipeline de legendagem clássico, qual é o papel do codificador visual?

O codificador (geralmente um CNN ou transformador de visão) transforma a imagem em vetores de recursos que o decodificador de linguagem usa.

Por que a atenção é útil na legenda de imagens?

A atenção ajuda o decodificador a 'olhar' as partes mais relevantes da imagem ao gerar cada palavra, melhorando o aterramento.

Qual conjunto de dados é amplamente utilizado para treinar e avaliar legendas de imagens?

O MS COCO fornece imagens, cada uma delas combinada com várias legendas escritas por humanos, tornando-o uma referência de legenda padrão.

O que significa para um decodificador de legenda gerar palavras 'autoregressivamente'?

A geração autorregressiva produz tokens um de cada vez, cada um condicionado aos tokens anteriores e à imagem.