Reducerea dimensionalității
Reducerea dimensionalității reduce datele din multe coloane (funcții) la câteva, păstrând în același timp structura importantă.
Prezentare generală
It fights the 'curse of dimensionality,' speeds up models, and lets you actually visualize complex data in 2D or 3D.
Scufundare în profunzime
Seturile de date reale au adesea sute sau mii de caracteristici: fiecare pixel dintr-o imagine, fiecare cuvânt dintr-un vocabular, fiecare senzor de pe o mașină. În astfel de spații cu dimensiuni mari, punctele de date devin rare și îndepărtate, măsurătorile distanțelor devin nesigure, iar modelele tind să supraadapteze zgomotului. Acesta este blestemul dimensionalității. Reducerea dimensionalității mapează datele în mult mai puține dimensiuni, păstrând în același timp relații semnificative. PCA face acest lucru liniar prin găsirea direcțiilor de cea mai mare varianță. t-SNE și UMAP sunt neliniare și excelează la dezvăluirea clusterelor pentru vizualizare. Reducerea dimensiunilor elimină caracteristicile redundante sau zgomotoase, reduce memoria și calculul și îmbunătățește frecvent acuratețea unui model din aval, deoarece există un semnal mai puțin irelevant pentru a-l confunda.
Perspectivă tehnică
PCA funcționează prin calculul covarianței caracteristicilor și găsirea de vectori proprii, „componentele principale”, care indică de-a lungul direcțiilor de variație maximă. Păstrați primele câteva componente și proiectați datele pe ele, eliminând direcțiile cu variație redusă, care sunt în mare parte zgomot. t-SNE și UMAP modelează în schimb relațiile de vecin: ei încearcă să mențină punctele care erau apropiate în dimensiuni mari aproape în harta de dimensiuni joase. UMAP construiește un grafic al punctelor din apropiere, ceea ce îl face mai rapid decât t-SNE și mai bun în păstrarea structurii globale mai ample.
Impact strategic
Decizii mai clare
Vă ajută să separați afirmațiile tehnice clare de limbajul de marketing.
Cost și buget
Puteți pune întrebări de implementare mai bune înainte de a cheltui bani sau timp.
Echipa și fluxul de lucru
Echipele cu înțelegere comună iau decizii mai bune despre produse, politici și învățare.
Viitorul reducerii dimensionalității
Reducerea dimensionalității este acum un pas de rutină în interiorul conductelor mai mari de AI, mai degrabă decât o sarcină de sine stătătoare. UMAP a devenit în mare parte implicită pentru explorarea înglobărilor din modele mari de limbaj și viziune, în care inginerii proiectează mii de dimensiuni într-o hartă 2D pentru a inspecta ceea ce a învățat un model. Așteptați-vă la o integrare mai strânsă cu tablouri de bord interactive, implementări mai rapide accelerate de GPU pentru seturi de date cu miliarde de rânduri și o utilizare tot mai mare în munca de interpretabilitate, în care cercetătorii reduc activările interne ale unui model pentru a înțelege și a depana comportamentul acestuia.
Implementare în lumea reală
Trasarea înglobărilor de cuvinte sau propoziții dintr-un model de limbă în 2D cu UMAP pentru a vedea ce concepte grupează modelul
Comprimarea a mii de măsurători ale expresiei genelor per pacient în câteva componente înainte de gruparea subtipurilor de boală
Reducerea caracteristicilor de imagine înainte de a le furniza unui clasificator, astfel încât antrenamentul să fie mai rapid și mai puțin predispus la supraadaptare
Vizualizarea comportamentului clienților în sute de valori ca un grafic de dispersie 2D pentru a identifica segmente distincte de piață
Riscuri și balustrade
Echipe diferite pot folosi același termen în mod diferit, așa că definiți domeniul de aplicare din timp.
Benchmark-urile pot părea puternice, în timp ce performanța în lumea reală este neuniformă.
Ignorarea calității datelor și a planurilor de evaluare generează adesea rezultate fragile.
Foaia de parcurs de implementare
Începeți cu o definiție simplă a rezultatului de care aveți nevoie.
Alegeți o măsură de succes și o condiție de eșec înainte de testare.
Rulați un pilot mic cu date reprezentative, nu un set demonstrativ bine definit.
Document în care Reducerea dimensionalității ajută și unde metodele mai simple sunt mai bune.
Continuați să explorați
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Dimensionality Reduction quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Următorul ghid
Gemenii Barlow și reducerea redundanței
Întrebări frecvente
What is Dimensionality Reduction?
Reducerea dimensionalității reduce datele din multe coloane (funcții) la câteva, păstrând în același timp structura importantă. Combate „blestemul dimensionalității”, accelerează modelele și vă permite să vizualizați efectiv date complexe în 2D sau 3D.
Ce este „blestemul dimensionalității”?
În spațiile cu dimensiuni foarte mari, punctele se împrăștie departe, iar măsurile de distanță se strică, așa că modelele se chinuie să găsească modele și tind să se supraîntâlnească.
Cum decide PCA ce direcții să păstreze?
PCA găsește componentele principale, axele cu cea mai mare variație și le păstrează pe cele de sus, deoarece transportă cele mai multe informații.
De ce se numește PCA o metodă „liniară”?
Fiecare componentă principală este o combinație liniară a caracteristicilor originale, astfel încât PCA nu poate captura o structură curbă, neliniară, așa cum o pot face t-SNE sau UMAP.
La ce sunt deosebit de bune t-SNE și UMAP?
Ambele sunt tehnici neliniare care mențin punctele din apropiere în apropiere pe harta cu dimensiuni reduse, făcând clusterele vizibile în 2D sau 3D.