Aprendizagem Auto-Supervisionada
A aprendizagem autossupervisionada treina modelos em dados não rotulados, inventando uma tarefa cuja resposta está oculta dentro dos próprios dados.
Visão geral
It is how modern language and vision foundation models learn from the raw internet without armies of human labelers.
Mergulho profundo
Rotular dados manualmente é lento e caro, mas o mundo está cheio de textos, imagens, áudio e vídeos não rotulados. A aprendizagem auto-supervisionada desbloqueia-a através da criação de “tarefas de pretexto” onde os dados fornecem a sua própria resposta. O exemplo clássico é a modelagem de linguagem mascarada, usada pelo BERT: ocultar algumas palavras em uma frase e treinar o modelo para predizê-las a partir do contexto. Os modelos no estilo GPT prevêem a próxima palavra. Na visão, métodos contrastivos como o SimCLR mostram ao modelo dois cortes aumentados da mesma imagem e ensinam que eles pertencem um ao outro enquanto separam imagens diferentes. Resolver esses quebra-cabeças feitos por você mesmo força o modelo a construir representações internas ricas de significado e estrutura. Essas representações são então transferidas poderosamente para tarefas posteriores reais com poucos ou nenhum dado rotulado.
Visão Técnica
O truque é gerar um sinal de supervisão gratuitamente. Na modelagem mascarada, o token oculto é o rótulo, portanto, uma perda pode ser calculada sem qualquer anotação humana. Na aprendizagem contrastiva, dois aumentos de uma imagem formam um “par positivo” que deve ficar próximo no espaço de incorporação, enquanto outras imagens são “negativas” afastadas. De qualquer forma, o modelo é otimizado em rótulos derivados puramente da própria estrutura dos dados, aprendendo recursos gerais que posteriormente precisam apenas de um leve ajuste fino.
Impacto Estratégico
Decisões mais claras
Ajuda a separar afirmações técnicas claras da linguagem de marketing.
Custo e orçamento
Você pode fazer perguntas melhores sobre implementação antes de gastar dinheiro ou tempo.
Equipe e fluxo de trabalho
Equipes com entendimento compartilhado tomam melhores decisões sobre produtos, políticas e aprendizado.
O futuro da aprendizagem auto-supervisionada
A aprendizagem autossupervisionada é o motor por trás dos modelos básicos atuais, e essa função só aumentará. A tendência clara é para o pré-treinamento multimodal, onde um único modelo aprende em conjunto a partir de texto, imagens, áudio e vídeo usando objetivos auto-supervisionados. Os pesquisadores estão indo além dos métodos contrastivos em direção a abordagens de previsão mascarada em visão e técnicas de autodestilação que não precisam de exemplos negativos. À medida que dados rotulados de alta qualidade se tornam o gargalo, aprender estruturas úteis diretamente de vastos fluxos não rotulados continuará sendo a estratégia central para dimensionar a IA.
Implementação no mundo real
BERT aprendendo linguagem prevendo palavras mascaradas e depois ajustando para pesquisa, sentimento ou resposta a perguntas
SimCLR pré-treinando um codificador de imagem em fotos não rotuladas para que possa posteriormente classificar com poucos rótulos
Modelos no estilo GPT que aprendem a escrever prevendo repetidamente o próximo token em grandes corpora de texto
Modelos de fala pré-treinados em áudio bruto não rotulado (prevendo segmentos de som mascarados) antes de serem adaptados para transcrição
Riscos e guarda-corpos
Equipes diferentes podem usar o mesmo termo de maneira diferente, portanto, defina o escopo com antecedência.
Os benchmarks podem parecer fortes, enquanto o desempenho no mundo real é irregular.
Ignorar a qualidade dos dados e os planos de avaliação cria frequentemente resultados frágeis.
Roteiro de implementação
Comece com uma definição em linguagem simples do resultado que você precisa.
Escolha uma métrica de sucesso e uma condição de falha antes de testar.
Execute um pequeno piloto com dados representativos, não um conjunto de demonstração sofisticado.
Documente onde a aprendizagem auto-supervisionada ajuda e onde métodos mais simples são melhores.
Continue explorando
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Self-Supervised Learning quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Próximo guia
Aprendizagem Supervisionada
Perguntas frequentes
What is Self-Supervised Learning?
A aprendizagem autossupervisionada treina modelos em dados não rotulados, inventando uma tarefa cuja resposta está oculta dentro dos próprios dados. É assim que os modelos modernos de linguagem e visão aprendem com a Internet bruta, sem exércitos de rotuladores humanos.
O que torna a aprendizagem 'auto-supervisionada'?
A aprendizagem autossupervisionada inventa uma tarefa de pretexto em que a resposta está oculta nos dados, de modo que nenhuma rotulagem humana é necessária.
Por que o aprendizado autossupervisionado é tão valioso para modelos básicos?
Como o sinal de supervisão vem dos próprios dados, os modelos podem ser pré-treinados em enormes corpora não rotulados da web.
Após o pré-treinamento auto-supervisionado, o que geralmente acontece a seguir?
O pré-treinamento cria representações gerais que são bem transferidas, portanto, apenas um leve ajuste fino nos dados rotulados é necessário para tarefas específicas.
Como a tarefa autosupervisionada de um modelo estilo GPT difere da do BERT?
Os modelos estilo GPT são treinados para prever o próximo token em uma sequência, enquanto o BERT prevê tokens mascarados usando o contexto esquerdo e direito.