Alapok ÚTMUTATÓ

Dimenziócsökkentés

A dimenziócsökkentés számos oszlopból (szolgáltatásból) néhányra csökkenti az adatokat, miközben megtartja a fontos szerkezetet.

2 perc olvasásUtoljára frissítve

Áttekintés

It fights the 'curse of dimensionality,' speeds up models, and lets you actually visualize complex data in 2D or 3D.

Mély merülés

A valódi adatkészletek gyakran több száz vagy ezer funkciót tartalmaznak: a kép minden pixelét, a szókincs minden szót, a gép minden érzékelőjét. Az ilyen nagy dimenziójú terekben az adatpontok megritkulnak és távol vannak egymástól, a távolságmérés megbízhatatlanná válik, és a modellek általában túlillesztik a zajt. Ez a dimenzionalitás átka. A dimenziócsökkentés az adatokat sokkal kevesebb dimenzióra képezi le, miközben megőrzi az értelmes kapcsolatokat. A PCA ezt lineárisan teszi a legnagyobb variancia irányainak megtalálásával. A t-SNE és az UMAP nemlineáris, és kiválóan alkalmas a klaszterek megjelenítésére. A méretek csökkentése eltávolítja a redundáns vagy zajos funkciókat, csökkenti a memóriát és a számításokat, és gyakran javítja a downstream modellek pontosságát, mivel kevesebb irreleváns jel zavarja meg.

Technikai betekintés

A PCA úgy működik, hogy kiszámítja a jellemzők kovarianciáját, és megtalálja azokat a sajátvektorokat, a „főkomponenseket”, amelyek a maximális variancia iránya mentén mutatnak. Megtartja a legfelső néhány összetevőt, és adatokat vetít rájuk, elveti az alacsony szórású irányokat, amelyek többnyire zajok. A t-SNE és az UMAP ehelyett szomszédsági kapcsolatokat modellez: igyekeznek a kisdimenziós térképen közel tartani azokat a pontokat, amelyek magas dimenzióban közel voltak. Az UMAP grafikont készít a közeli pontokról, ami gyorsabbá teszi, mint a t-SNE, és jobban megőrzi a szélesebb globális struktúrát.

Stratégiai hatás

Tisztább döntések

Segít elkülöníteni a világos technikai állításokat a marketing nyelvezettől.

Költség és költségvetés

Feltehet jobb végrehajtási kérdéseket, mielőtt pénzt vagy időt költene.

Csapat és munkafolyamat

A közös tudással rendelkező csapatok jobb döntéseket hoznak a termékekkel, irányelvekkel és tanulással kapcsolatban.

A dimenziócsökkentés jövője

A dimenziócsökkentés ma már rutin lépés a nagyobb mesterségesintelligencia-folyamatokon belül, nem pedig önálló feladat. Az UMAP nagyrészt alapértelmezetté vált a nagy nyelvi és látási modellek beágyazásainak felfedezéséhez, ahol a mérnökök több ezer dimenziót vetítenek ki egy 2D-s térképbe, hogy megvizsgálják, mit tanult a modell. Az interaktív irányítópultokkal való szorosabb integrációra, a milliárdsoros adatkészletek gyorsabb GPU-gyorsítására, valamint az értelmezhetőségi munkában való növekvő felhasználásra lehet számítani, ahol a kutatók csökkentik a modell belső aktiválásait, hogy megértsék és hibakeresése érdekében a modell viselkedését.

Valós megvalósítás

Szó- vagy mondatbeágyazás ábrázolása egy nyelvi modellből 2D-ben UMAP-pal, hogy megtudja, mely fogalmakat csoportosítja a modell

Betegenként több ezer génexpressziós mérés tömörítése néhány komponensbe, mielőtt a betegség altípusait csoportosítaná

Csökkentse a képjellemzőket, mielőtt beadná őket egy osztályozóba, így az edzés gyorsabb és kevésbé hajlamos a túlillesztésre

Az ügyfelek viselkedésének megjelenítése több száz mérőszámon 2D-s szóródási diagramként, hogy felismerje a különböző piaci szegmenseket

Kockázatok és védőkorlátok

A különböző csapatok eltérően használhatják ugyanazt a kifejezést, ezért korán határozza meg a hatókört.

A benchmarkok erősnek tűnhetnek, miközben a valós teljesítmény egyenetlen.

Az adatminőségi és értékelési tervek figyelmen kívül hagyása gyakran törékeny eredményekhez vezet.

Végrehajtási ütemterv

1

Kezdje a kívánt eredmény egyszerű nyelvű meghatározásával.

2

A tesztelés előtt válasszon egy sikermutatót és egy hibafeltételt.

3

Futtasson egy kis pilotot reprezentatív adatokkal, ne egy csiszolt demókészlettel.

4

Dokumentálja, ahol a dimenziócsökkentés segít, és hol jobbak az egyszerűbb módszerek.

Folytassa a felfedezést

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Dimensionality Reduction quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Kezdő kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Következő útmutató

Barlow ikrek és redundanciacsökkentés

Gyakran ismételt kérdések

What is Dimensionality Reduction?

A dimenziócsökkentés számos oszlopból (szolgáltatásból) néhányra csökkenti az adatokat, miközben megtartja a fontos szerkezetet. Felveszi a harcot a „dimenzionalitás átka” ellen, felgyorsítja a modellezést, és lehetővé teszi az összetett adatok tényleges megjelenítését 2D-ben vagy 3D-ben.

Mi a „dimenzionalitás átka”?

A nagyon nagy dimenziójú terekben a pontok távol helyezkednek el egymástól, és a távolságmértékek lebomlanak, így a modellek nehezen találnak mintákat, és hajlamosak túlilleszkedni.

Hogyan dönti el a PCA, hogy melyik irányt tartsa be?

A PCA megkeresi a főkomponenseket, a legnagyobb szórás tengelyeit, és megtartja a felsőket, mert ezek hordozzák a legtöbb információt.

Miért nevezik a PCA-t „lineáris” módszernek?

Minden fő komponens az eredeti jellemzők lineáris kombinációja, így a PCA nem képes ívelt, nemlineáris struktúrát rögzíteni, ahogyan a t-SNE vagy az UMAP képes.

Miben különösen jó a t-SNE és az UMAP?

Mindkettő nemlineáris technika, amely a közeli pontokat a közelben tartja az alacsony dimenziós térképen, így a klaszterek láthatóak 2D-ben vagy 3D-ben.