GUIA de fundamentos

Redução de dimensionalidade

A redução da dimensionalidade reduz os dados de muitas colunas (recursos) para algumas, mantendo a estrutura importante.

2 minutos de leituraÚltima atualização

Visão geral

Ele combate a 'maldição da dimensionalidade', acelera os modelos e permite visualizar dados complexos em 2D ou 3D.

Mergulho profundo

Conjuntos de dados reais geralmente têm centenas ou milhares de recursos: cada pixel de uma imagem, cada palavra de um vocabulário, cada sensor de uma máquina. Em espaços tão dimensionais, os pontos de dados tornam-se esparsos e distantes, as medições de distância tornam-se pouco confiáveis ​​e os modelos tendem a ajustar-se excessivamente ao ruído. Esta é a maldição da dimensionalidade. A redução da dimensionalidade mapeia os dados em muito menos dimensões, preservando relacionamentos significativos. O PCA faz isso linearmente, encontrando as direções de maior variação. t-SNE e UMAP são não lineares e excelentes na revelação de clusters para visualização. A redução das dimensões remove recursos redundantes ou ruidosos, reduz a memória e a computação e frequentemente melhora a precisão de um modelo downstream porque há menos sinais irrelevantes para confundi-lo.

Visão Técnica

O PCA funciona calculando a covariância dos recursos e encontrando autovetores, os 'componentes principais', que apontam ao longo de direções de variância máxima. Você mantém os poucos componentes principais e os dados do projeto neles, descartando direções de baixa variação que são principalmente ruídos. Em vez disso, t-SNE e UMAP modelam relacionamentos de vizinhança: eles tentam manter os pontos que estavam próximos em dimensões altas próximos no mapa de baixa dimensão. UMAP constrói um gráfico de pontos próximos, o que o torna mais rápido que o t-SNE e melhor na preservação de uma estrutura global mais ampla.

Impacto Estratégico

Decisões mais claras

Ajuda a separar afirmações técnicas claras da linguagem de marketing.

Custo e orçamento

Você pode fazer perguntas melhores sobre implementação antes de gastar dinheiro ou tempo.

Equipe e fluxo de trabalho

Equipes com entendimento compartilhado tomam melhores decisões sobre produtos, políticas e aprendizado.

O futuro da redução da dimensionalidade

A redução da dimensionalidade é agora uma etapa rotineira dentro de pipelines de IA maiores, em vez de uma tarefa autônoma. O UMAP tornou-se em grande parte o padrão para explorar incorporações de grandes modelos de linguagem e visão, onde os engenheiros projetam milhares de dimensões em um mapa 2D para inspecionar o que um modelo aprendeu. Espere uma integração mais estreita com painéis interativos, implementações aceleradas por GPU mais rápidas para conjuntos de dados de bilhões de linhas e uso crescente em trabalhos de interpretabilidade, onde os pesquisadores reduzem as ativações internas de um modelo para compreender e depurar seu comportamento.

Implementação no mundo real

Plotar incorporações de palavras ou frases de um modelo de linguagem em 2D com UMAP para ver quais conceitos o modelo agrupa

Comprimir milhares de medições de expressão genética por paciente em alguns componentes antes de agrupar subtipos de doenças

Reduzir os recursos da imagem antes de alimentá-los em um classificador, para que o treinamento seja mais rápido e menos sujeito a overfitting

Visualização do comportamento do cliente em centenas de métricas como um gráfico de dispersão 2D para identificar segmentos de mercado distintos

Riscos e guarda-corpos

Equipes diferentes podem usar o mesmo termo de maneira diferente, portanto, defina o escopo com antecedência.

Os benchmarks podem parecer fortes, enquanto o desempenho no mundo real é irregular.

Ignorar a qualidade dos dados e os planos de avaliação cria frequentemente resultados frágeis.

Roteiro de implementação

1

Comece com uma definição em linguagem simples do resultado que você precisa.

2

Escolha uma métrica de sucesso e uma condição de falha antes de testar.

3

Execute um pequeno piloto com dados representativos, não um conjunto de demonstração sofisticado.

4

Documente onde a Redução de Dimensionalidade ajuda e onde métodos mais simples são melhores.

Continue explorando

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Dimensionality Reduction quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Iniciar teste

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Próximo guia

Barlow Twins e redução de redundância

Perguntas frequentes

O que é Redução de Dimensionalidade?

A redução da dimensionalidade reduz os dados de muitas colunas (recursos) para algumas, mantendo a estrutura importante. Ele combate a 'maldição da dimensionalidade', acelera modelos e permite visualizar dados complexos em 2D ou 3D.

O que é a 'maldição da dimensionalidade'?

Em espaços de dimensões muito altas, os pontos se espalham e as medidas de distância são interrompidas, de modo que os modelos têm dificuldade para encontrar padrões e tendem a se ajustar demais.

Como o PCA decide quais instruções seguir?

O PCA encontra os componentes principais, os eixos de maior variação, e mantém os principais porque carregam mais informações.

Por que o PCA é chamado de método 'linear'?

Cada componente principal é uma combinação linear dos recursos originais, portanto, o PCA não pode capturar estruturas curvas e não lineares da mesma forma que t-SNE ou UMAP.

Em que o t-SNE e o UMAP são especialmente bons?

Ambas são técnicas não lineares que mantêm pontos próximos no mapa de baixa dimensão, tornando os clusters visíveis em 2D ou 3D.