Önfelügyelt tanulás
Az önfelügyelt tanulás modelleket képez a címkézetlen adatokon egy olyan feladat kitalálásával, amelynek válasza magában az adatban van elrejtve.
Áttekintés
It is how modern language and vision foundation models learn from the raw internet without armies of human labelers.
Mély merülés
Az adatok kézi címkézése lassú és drága, mégis a világ tele van címkézetlen szövegekkel, képekkel, hanggal és videóval. Az önfelügyelt tanulás „ürügyfeladatok” létrehozásával oldja meg a zárolást, ahol az adatok megadják a saját választ. A klasszikus példa a BERT által használt maszkolt nyelvi modellezés: rejtsen el néhány szót a mondatban, és tanítsa meg a modellt, hogy előre jelezze őket a kontextusból. A GPT-stílusú modellek megjósolják a következő szót. A látásban a kontrasztos módszerek, mint például a SimCLR, ugyanazon kép két kibővített kivágását mutatják be a modellnek, és megtanítják neki, hogy ezek összetartoznak, miközben eltolja a különböző képeket. Ezeknek a saját készítésű rejtvényeknek a megoldása arra kényszeríti a modellt, hogy gazdag belső jelentés- és szerkezeti reprezentációkat építsen fel. Ezek a reprezentációk ezután hatékonyan továbbadnak valódi downstream feladatokhoz, kevés vagy semmilyen címkézett adattal.
Technikai betekintés
A trükk az, hogy ingyenesen generál egy felügyeleti jelet. A maszkolt modellezésben a rejtett token a címke, így a veszteség emberi megjegyzés nélkül is kiszámítható. A kontrasztív tanulás során egy kép két kibővítése „pozitív párt” alkot, amelynek szorosan kell elhelyezkednie a beágyazott térben, míg a többi kép „negatívuma” el van tolva. Akárhogy is, a modell a pusztán az adatok saját struktúrájából származó címkékre van optimalizálva, megtanulva az általános jellemzőket, amelyek később csak enyhe finomhangolást igényelnek.
Stratégiai hatás
Tisztább döntések
Segít elkülöníteni a világos technikai állításokat a marketing nyelvezettől.
Költség és költségvetés
Feltehet jobb végrehajtási kérdéseket, mielőtt pénzt vagy időt költene.
Csapat és munkafolyamat
A közös tudással rendelkező csapatok jobb döntéseket hoznak a termékekkel, irányelvekkel és tanulással kapcsolatban.
Az önfelügyelt tanulás jövője
Az önfelügyelt tanulás a mai alapmodellek motorja, és ez a szerep csak növekedni fog. Az egyértelmű tendencia a multimodális előképzés irányába mutat, ahol egyetlen modell közösen tanul szövegből, képekből, hangból és videóból, önfelügyelt célok segítségével. A kutatók a kontrasztív módszereken túl a maszkos előrejelzési megközelítések felé törekszenek a látásban és az öndesztillációs technikákban, amelyekhez nincs szükség negatív példákra. Ahogy a jó minőségű címkézett adatok szűk keresztmetszetté válnak, az AI méretezésének központi stratégiája továbbra is a hasznos szerkezetek megtanulása közvetlenül a hatalmas, címkézetlen adatfolyamokból marad.
Valós megvalósítás
A BERT megtanulja a nyelvet az elfedett szavak előrejelzésével, majd finomhangolása a kereséshez, a hangulathoz vagy a kérdések megválaszolásához
A SimCLR előtanítja a képkódolót címkézetlen fényképeken, így később nagyon kevés címkével képes osztályozni
A GPT-stílusú modellek úgy tanulnak írni, hogy ismételten megjósolják a következő tokent hatalmas szövegkorpusokon keresztül
A beszédmodellek előképzett nyers, címkézetlen hangra (maszkolt hangszegmensek előrejelzése), mielőtt az átíráshoz igazították volna
Kockázatok és védőkorlátok
A különböző csapatok eltérően használhatják ugyanazt a kifejezést, ezért korán határozza meg a hatókört.
A benchmarkok erősnek tűnhetnek, miközben a valós teljesítmény egyenetlen.
Az adatminőségi és értékelési tervek figyelmen kívül hagyása gyakran törékeny eredményekhez vezet.
Végrehajtási ütemterv
Kezdje a kívánt eredmény egyszerű nyelvű meghatározásával.
A tesztelés előtt válasszon egy sikermutatót és egy hibafeltételt.
Futtasson egy kis pilotot reprezentatív adatokkal, ne egy csiszolt demókészlettel.
Dokumentálja, hol segít a Self-Supervised Learning, és hol jobbak az egyszerűbb módszerek.
Folytassa a felfedezést
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Self-Supervised Learning quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Következő útmutató
Felügyelt tanulás
Gyakran ismételt kérdések
What is Self-Supervised Learning?
Az önfelügyelt tanulás modelleket képez a címkézetlen adatokon egy olyan feladat kitalálásával, amelynek válasza magában az adatban van elrejtve. Így tanulnak a modern nyelvi és látási alapmodellek a nyers internetről, emberi címkézők hadai nélkül.
Mi teszi a tanulást „önfelügyeltté”?
Az önfelügyelt tanulás egy ürügy-feladatot talál ki, ahol a válasz az adatokban van elrejtve, így nincs szükség emberi címkézésre.
Miért olyan értékes az önfelügyelt tanulás az alapozó modellek számára?
Mivel a felügyeleti jel magából az adatból származik, a modelleket hatalmas, címkézetlen korpuszokra lehet előképezni az internetről.
Az önfelügyelt előképzés után általában mi történik ezután?
Az előképzés általános reprezentációkat készít, amelyek jól továbbíthatók, így a konkrét feladatokhoz csak a címkézett adatok enyhe finomhangolása szükséges.
Miben különbözik egy GPT-stílusú modell önfelügyelt feladata a BERT-től?
A GPT-stílusú modelleket arra tanítják, hogy megjósolják a sorozat következő tokent, míg a BERT előrejelzi a maszkolt tokeneket bal és jobb kontextus használatával.