PODSTAWOWY PRZEWODNIK

Redukcja wymiarowości

Redukcja wymiarowości zmniejsza dane z wielu kolumn (cech) do kilku, zachowując jednocześnie ważną strukturę.

2 minuty czytaniaOstatnia aktualizacja

Przegląd

It fights the 'curse of dimensionality,' speeds up models, and lets you actually visualize complex data in 2D or 3D.

Głębokie nurkowanie

Prawdziwe zbiory danych często mają setki lub tysiące funkcji: każdy piksel obrazu, każde słowo w słowniku, każdy czujnik w maszynie. W takich wielowymiarowych przestrzeniach punkty danych stają się rzadkie i oddalone od siebie, pomiary odległości stają się niewiarygodne, a modele mają tendencję do nadmiernego dopasowania szumu. To jest przekleństwo wymiarowości. Redukcja wymiarowości mapuje dane na znacznie mniej wymiarów, zachowując jednocześnie znaczące relacje. PCA robi to liniowo, znajdując kierunki największej wariancji. t-SNE i UMAP są nieliniowe i doskonale nadają się do ujawniania klastrów do wizualizacji. Zmniejszanie wymiarów usuwa zbędne lub zaszumione funkcje, ogranicza pamięć i obliczenia, a często poprawia dokładność późniejszego modelu, ponieważ jest mniej nieistotnego sygnału, który mógłby go zmylić.

Wgląd techniczny

PCA działa poprzez obliczanie kowariancji cech i znajdowanie wektorów własnych, „głównych składowych”, które wskazują kierunki maksymalnej wariancji. Zachowujesz kilka najwyższych komponentów i rzutujesz na nie dane, odrzucając kierunki o niskiej wariancji, które są głównie szumem. Zamiast tego t-SNE i UMAP modelują relacje sąsiedzkie: starają się, aby punkty, które były blisko w wysokich wymiarach, były blisko na mapie niskowymiarowej. UMAP tworzy wykres pobliskich punktów, dzięki czemu jest szybszy niż t-SNE i lepiej zachowuje szerszą strukturę globalną.

Wpływ strategiczny

Jaśniejsze decyzje

Pomaga oddzielić jasne twierdzenia techniczne od języka marketingowego.

Koszt i budżet

Możesz zadawać pytania dotyczące lepszego wdrożenia, zanim wydasz pieniądze lub czas.

Zespół i przepływ pracy

Zespoły charakteryzujące się wspólnym zrozumieniem podejmują lepsze decyzje dotyczące produktów, zasad i uczenia się.

Przyszłość redukcji wymiarowości

Redukcja wymiarowości jest teraz rutynowym krokiem w większych potokach AI, a nie samodzielnym zadaniem. UMAP stał się w dużej mierze domyślnym narzędziem do badania osadzania z dużych modeli językowych i wizyjnych, podczas których inżynierowie rzutują tysiące wymiarów na mapę 2D, aby sprawdzić, czego nauczył się model. Spodziewaj się ściślejszej integracji z interaktywnymi pulpitami nawigacyjnymi, szybszych implementacji akcelerowanych przez procesor graficzny dla zestawów danych zawierających miliardy wierszy oraz rosnącego wykorzystania w pracach nad interpretacją, w których badacze ograniczają wewnętrzne aktywacje modelu, aby zrozumieć i debugować jego zachowanie.

Implementacja w świecie rzeczywistym

Wykreślanie osadzonych słów lub zdań z modelu językowego w 2D za pomocą UMAP, aby zobaczyć, które pojęcia grupuje model

Kompresja tysięcy pomiarów ekspresji genów na pacjenta do kilku elementów przed grupowaniem podtypów chorób

Redukcja cech obrazu przed przekazaniem ich do klasyfikatora, dzięki czemu szkolenie jest szybsze i mniej podatne na nadmierne dopasowanie

Wizualizacja zachowań klientów na podstawie setek wskaźników w postaci wykresu punktowego 2D w celu wykrycia różnych segmentów rynku

Zagrożenia i poręcze

Różne zespoły mogą odmiennie używać tego samego terminu, dlatego należy wcześniej zdefiniować zakres.

Testy porównawcze mogą wyglądać dobrze, podczas gdy wydajność w świecie rzeczywistym jest nierówna.

Ignorowanie planów dotyczących jakości danych i oceny często skutkuje kruchymi wynikami.

Plan wdrożenia

1

Zacznij od jasnej definicji potrzebnego wyniku.

2

Przed testowaniem wybierz jedną metrykę sukcesu i jeden warunek niepowodzenia.

3

Przeprowadź mały pilotaż z reprezentatywnymi danymi, a nie dopracowanym zestawem demonstracyjnym.

4

Dokumentuj, gdzie pomaga redukcja wymiarów i gdzie prostsze metody są lepsze.

Odkrywaj dalej

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Dimensionality Reduction quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Rozpocznij quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Następny poradnik

Bliźniaki Barlowa i redukcja redundancji

Często zadawane pytania

What is Dimensionality Reduction?

Redukcja wymiarowości zmniejsza dane z wielu kolumn (cech) do kilku, zachowując jednocześnie ważną strukturę. Zwalcza „przekleństwo wymiarowości”, przyspiesza modele i pozwala faktycznie wizualizować złożone dane w 2D lub 3D.

Na czym polega „przekleństwo wymiarowości”?

W przestrzeniach o bardzo dużych wymiarach punkty są bardzo od siebie oddalone, a miary odległości załamują się, przez co modele mają trudności ze znalezieniem wzorców i mają tendencję do nadmiernego dopasowania.

W jaki sposób PCA decyduje, które kierunki należy zachować?

PCA znajduje główne składowe, osie największej wariancji i zatrzymuje te najważniejsze, ponieważ niosą najwięcej informacji.

Dlaczego PCA nazywa się metodą „liniową”?

Każdy główny komponent jest liniową kombinacją oryginalnych cech, więc PCA nie jest w stanie uchwycić zakrzywionej, nieliniowej struktury w taki sposób, w jaki potrafią to t-SNE lub UMAP.

W czym t-SNE i UMAP są szczególnie dobre?

Obie są technikami nieliniowymi, które utrzymują pobliskie punkty na niskowymiarowej mapie, dzięki czemu klastry są widoczne w 2D lub 3D.