Transformadores de visão
Vision Transformers (ViTs) aplicam a arquitetura do transformador que alimenta ChatGPT às imagens, tratando uma imagem como uma sequência de patches em vez de uma grade de pixels.
Visão geral
They proved that you do not need convolutions to achieve state-of-the-art image recognition.
Mergulho profundo
Durante anos, as redes neurais convolucionais (CNNs) dominaram a visão computacional ao digitalizar pequenos filtros em uma imagem. O artigo de 2020 'Uma imagem vale 16x16 palavras' de Google desafiou isso cortando uma imagem em fragmentos fixos, normalmente 16x16 pixels, achatando cada um em um vetor e alimentando a sequência resultante em um transformador padrão. Cada patch se torna um 'token', muito parecido com uma palavra em uma frase. O modelo então usa a autoatenção para que cada patch possa se relacionar diretamente com todos os outros patches, capturando relacionamentos de longo alcance que um pequeno filtro convolucional não consegue ver em uma única etapa. O problema: os ViTs têm fome de dados porque não possuem as suposições incorporadas das CNNs. Treinados em enormes conjuntos de dados como o JFT-300M, eles igualaram ou superaram as melhores CNNs, remodelando a pesquisa moderna sobre visão.
Visão Técnica
Um ViT divide uma imagem em patches não sobrepostos, projeta cada um linearmente em uma incorporação e adiciona codificações posicionais para que o modelo saiba onde cada patch estava na imagem original. Um 'token de classe' especial que pode ser aprendido é anexado; sua representação final impulsiona a classificação. Camadas de autoatenção empilhadas permitem que cada patch avalie as informações de todas as outras, fornecendo um campo receptivo global da camada um. Como a atenção aumenta quadraticamente com o número de patches, as imagens de alta resolução tornam-se caras, e é por isso que o tamanho do patch e as variantes de atenção eficientes são importantes.
Impacto Estratégico
Velocidade e escala
A IA visual pode automatizar tarefas de inspeção, detecção e marcação em grande escala.
Escolhas de construção
As equipes criativas podem criar protótipos de conceitos mais rapidamente e com menos revisões manuais.
Equipe e fluxo de trabalho
As operações podem usar sinais de imagem e vídeo que antes eram difíceis de processar.
O futuro dos transformadores de visão
Os híbridos de transformadores ViTs e CNN agora alimentam os principais sistemas de visão, e a arquitetura sustenta modelos multimodais que fundem imagens com texto, como CLIP e modernos assistentes de linguagem de visão. Espere um trabalho contínuo para tornar a atenção mais barata para alta resolução e vídeo, além de pré-treinamento auto-supervisionado (como modelagem de imagem mascarada) que reduz o enorme apetite por dados rotulados. À medida que a computação cresce, a linha entre o “modelo de linguagem” e o “modelo de visão” continua a confundir-se, com os transformadores a servirem como uma espinha dorsal partilhada entre modalidades, em vez de designs especializados separados.
Implementação no mundo real
Sistemas de classificação de imagens e classificação de pesquisa de Google que adotaram backbones de transformadores depois que ViT se mostrou competitivo com CNNs
CLIP e outros modelos de imagem-texto que usam ViT para codificar imagens para que fotos e legendas possam ser combinadas em um espaço compartilhado
Pesquisa de imagens médicas usando ViTs para detectar padrões em todo o exame, em vez de apenas texturas locais
Pilhas de percepção autônoma e robótica que combinam atenção no estilo ViT para compreensão da cena em todo o campo de visão
Riscos e guarda-corpos
Os direitos de imagem e o consentimento podem tornar-se riscos legais se a proveniência não for clara.
O desempenho do modelo pode variar dependendo da iluminação, dados demográficos e ambientes.
Os falsos positivos podem passar despercebidos, a menos que os limites de confiança sejam monitorados.
Roteiro de implementação
Defina critérios de aceitação para precisão, recall e custos de erro.
Teste com dados que correspondam às condições reais de produção.
Adicione revisão humana para previsões de baixa confiança ou de alto impacto.
Rastreie o desvio do modelo e revalide após alterações na câmera ou no conjunto de dados.
Continue explorando
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Vision Transformers quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Próximo guia
Modelos CLIP e Vision-Language
Perguntas frequentes
What is Vision Transformers?
Vision Transformers (ViTs) aplicam a arquitetura do transformador que alimenta ChatGPT às imagens, tratando uma imagem como uma sequência de patches em vez de uma grade de pixels. Eles provaram que não são necessárias circunvoluções para obter reconhecimento de imagem de última geração.
Como um Vision Transformer processa inicialmente uma imagem de entrada?
Um ViT divide a imagem em patches fixos (geralmente 16x16 pixels), incorpora cada patch como um token e alimenta a sequência em um transformador.
Qual mecanismo chave permite que um ViT relacione partes distantes de uma imagem entre si?
A autoatenção permite que cada patch pese diretamente as informações de todos os outros patches, proporcionando uma visão global desde a primeira camada.
Por que os transformadores de visão simples normalmente precisam de conjuntos de dados de treinamento muito grandes para se destacarem?
Ao contrário das CNNs, os ViTs não assumem invariância de localidade ou tradução, portanto, devem aprender esses padrões a partir de grandes quantidades de dados.
Qual é o propósito das codificações posicionais em um Vision Transformer?
A autoatenção é independente da ordem, portanto as codificações posicionais restauram a localização espacial de cada patch.
Qual afirmação reflete melhor o impacto do ViT na visão computacional?
A ViT demonstrou que um transformador puro, com dados e escala suficientes, pode rivalizar ou superar as melhores redes convolucionais.