Modelos CLIP e Vision-Language
CLIP é um modelo de OpenAI que aprende a conectar imagens e texto colocando ambos no mesmo espaço matemático.
Visão geral
It is the quiet workhorse behind image search, content moderation, and many text-to-image generators.
Mergulho profundo
Lançado em 2021, o CLIP (Contrastive Language-Image Pre-training) treinou em cerca de 400 milhões de pares de imagens-legendas extraídos da web. Ele usa dois codificadores: um transforma uma imagem em um vetor, o outro transforma um texto em um vetor e ambos ficam em um espaço de incorporação compartilhado. O modelo aprende que a foto de um cachorro e as palavras “a foto de um cachorro” ficam próximas umas das outras, enquanto pares incompatíveis ficam distantes. Isso desbloqueia a classificação zero shot: para rotular uma imagem, você a compara com as descrições de texto das categorias candidatas e escolhe a mais próxima, sem treinar um classificador dedicado. O CLIP tornou-se uma infraestrutura fundamental, orientando geradores de imagens, potencializando a pesquisa semântica de imagens, filtrando conjuntos de dados e propagando os maiores modelos de linguagem de visão atuais, como Flamingo, LLaVA e GPT-4V.
Visão Técnica
O CLIP é treinado com objetivo contrastivo. Em um lote de pares imagem-texto, ele calcula a similaridade (por meio da similaridade de cosseno) entre cada imagem e cada legenda e, em seguida, ajusta os codificadores para maximizar as pontuações para os pares corretos e minimizar as pontuações para todas as combinações erradas. O codificador de imagem é normalmente um Vision Transformer que divide uma imagem em fragmentos; o codificador de texto é um Transformer sobre tokens. Como ambos produzem vetores comparáveis, você pode combinar qualquer imagem com qualquer texto instantaneamente.
Impacto Estratégico
Velocidade e escala
A IA visual pode automatizar tarefas de inspeção, detecção e marcação em grande escala.
Escolhas de construção
As equipes criativas podem criar protótipos de conceitos mais rapidamente e com menos revisões manuais.
Equipe e fluxo de trabalho
As operações podem usar sinais de imagem e vídeo que antes eram difíceis de processar.
O futuro dos modelos CLIP e Vision-Language
O alinhamento no estilo CLIP agora é um alicerce dentro de modelos multimodais maiores que também podem conversar, raciocinar e responder perguntas sobre imagens. Espere conjuntos de treinamento maiores e mais limpos, suporte para vários idiomas e extensão para vídeo e áudio. Os pesquisadores estão trabalhando para reduzir os preconceitos sociais e demográficos que o CLIP absorveu dos dados da web e para melhorar a compreensão refinada (contagem de objetos, leitura de texto, relações espaciais) onde os modelos contrastantes permanecem fracos. À medida que versões abertas como o OpenCLIP amadurecem, essa cola de imagem e texto continuará se espalhando pelas ferramentas de pesquisa, robótica e acessibilidade.
Implementação no mundo real
Pesquisando uma biblioteca de fotos com frases naturais como “pôr do sol sobre as montanhas” em vez de tags de nome de arquivo
Orientar geradores de texto para imagem para que as saídas correspondam ao prompt solicitado
Sinalizar imagens inseguras ou fora da política, comparando-as com descrições de texto de conteúdo proibido
Organização automática ou legenda de grandes conjuntos de dados de imagens não rotuladas para pesquisa ou comércio eletrônico
Riscos e guarda-corpos
Os direitos de imagem e o consentimento podem tornar-se riscos legais se a proveniência não for clara.
O desempenho do modelo pode variar dependendo da iluminação, dados demográficos e ambientes.
Os falsos positivos podem passar despercebidos, a menos que os limites de confiança sejam monitorados.
Roteiro de implementação
Defina critérios de aceitação para precisão, recall e custos de erro.
Teste com dados que correspondam às condições reais de produção.
Adicione revisão humana para previsões de baixa confiança ou de alto impacto.
Rastreie o desvio do modelo e revalide após alterações na câmera ou no conjunto de dados.
Continue explorando
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the CLIP and Vision-Language Models quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Próximo guia
Modelos de visão-linguagem-ação para robótica
Perguntas frequentes
What is CLIP and Vision-Language Models?
CLIP é um modelo de OpenAI que aprende a conectar imagens e texto colocando ambos no mesmo espaço matemático. É o burro de carga silencioso por trás da pesquisa de imagens, moderação de conteúdo e muitos geradores de texto para imagem.
Qual é a ideia central por trás do CLIP?
O CLIP mapeia imagens e texto em um espaço vetorial compartilhado para que sua similaridade possa ser medida diretamente.
Qual abordagem de treinamento o CLIP usa?
O CLIP usa uma objetiva contrastiva: pares corretos de legenda de imagem são aproximados enquanto pares incompatíveis são separados.
O que significa 'classificação zero-shot' com CLIP?
O CLIP pode rotular imagens para as quais nunca foi treinado especificamente para classificar, comparando-as com descrições de texto de categorias candidatas.
Como o CLIP mede se uma imagem e uma legenda correspondem?
CLIP codifica cada um em um vetor e calcula a similaridade de cosseno; maior similaridade significa uma correspondência semântica mais próxima.
Aproximadamente em quantos dados o CLIP foi treinado?
O CLIP aprendeu com cerca de 400 milhões de pares de imagens e legendas coletados na Internet, proporcionando amplo conhecimento de linguagem visual.