Alapok ÚTMUTATÓ

Aktív tanulás

Az aktív tanulás egy olyan képzési stratégia, ahol a modell maga választja ki, hogy az ember mely címkézetlen példákat jelölje meg legközelebb.

2 perc olvasásUtoljára frissítve

Áttekintés

It matters because labeling data is expensive, and smart selection can reach high accuracy with a fraction of the annotations.

Mély merülés

A legtöbb felügyelt tanulás feltételezi, hogy már van egy nagy halom felcímkézett adat. Az aktív tanulás ezt megfordítja: egy kis címkézett készlettel és egy nagy mennyiségű címkézetlen példával kezdesz, majd ismételten megkérsz egy embert (az „orákulumot”), hogy csak a leginformatívabbakat címkézze meg. A modellt betanítják, a címkézetlen készlet pontozására használják, és a legmagasabb értékű példákat elküldik címkézésre – majd a ciklus megismétlődik. A gyakori kiválasztási stratégiák közé tartozik a bizonytalansági mintavétel (olyan példákat válasszon, amelyekben a modell a legkevésbé biztos), bizottságonkénti lekérdezés (azt válassza ki, ahol az együttes nem ért egyet), és a diverzitási mintavétel (az adatok különböző régióira terjed ki). Ha jól végezzük, az aktív tanulás a teljes adathalmaz pontosságát sokkal kevesebb címke használatával egyezik meg, ezért népszerű az orvosi képalkotásban, az NLP-ben és minden olyan területen, ahol a szakértői megjegyzések lassú vagy költségesek.

Technikai betekintés

Az alapötlet az, hogy megbecsüljük minden címkézetlen pont „értékét”, mielőtt fizetnénk a címkézésért. A bizonytalansági mintavétel a modell saját valószínűségeit használja – például kiválasztja azt a pontot, amelynek felső osztályú valószínűsége a legközelebb van a véletlenhez, vagy a legmagasabb entrópiával vagy a legkisebb különbséggel a felső két osztály között. A bizottságonkénti lekérdezés több modellt képez ki, és kiválasztja azokat a pontokat, amelyekben a leginkább nem értenek egyet. A kulcsfontosságú kockázat a mintavételi torzítás: a bizonytalanság mohó hajszolása egész régiókat figyelmen kívül hagyhat, ezért gyakran kombinálják a sokszínűséget vagy a kötegeltető módszereket.

Stratégiai hatás

Tisztább döntések

Segít elkülöníteni a világos technikai állításokat a marketing nyelvezettől.

Költség és költségvetés

Feltehet jobb végrehajtási kérdéseket, mielőtt pénzt vagy időt költene.

Csapat és munkafolyamat

A közös tudással rendelkező csapatok jobb döntéseket hoznak a termékekkel, irányelvekkel és tanulással kapcsolatban.

Az aktív tanulás jövője

Az aktív tanulást egyre gyakrabban párosítják nagyméretű előképzett és alapozó modellekkel, ahol a cél a minden címkézése helyett az olcsó finomhangolás felé tolódik el néhány nagy értékű példán. Szorosabb integrációra számíthat gyenge felügyelettel, önfelügyelt előképzéssel és humán-in-the-loop eszközökkel, amelyek címkéket javasolnak a lektoroknak, hogy megerősítsék, semmint létrehozzák. Mivel a címkézési költségek dominálnak sok valós telepítésnél, az automatizált kiválasztás és a hatékony annotációs interfészek továbbra is központi szerepet töltenek be a modellek felépítésében olyan speciális, adathiányos területeken, mint az orvostudomány és a jog.

Valós megvalósítás

Egy radiológiai csapat úgy képezi ki a tumordetektort, hogy a modell megjelöli a legkétértelműbb szkenneléseket a szakértő radiológusok számára, hogy megjelöljék, így drámaian lerövidítik az annotálási órákat.

A spam vagy tartalom-moderáló rendszer olyan határüzeneteket jelenít meg, amelyekben a legkevésbé biztos az emberi felülvizsgálók számára, és a leggyorsabban a kemény szélű eseteken fejlődik.

A beszédfelismerő cég olyan hangklipeket választ ki, ahol a modell a legbizonytalanabb (ékezetek, zaj), hogy elküldje átírásra, ahelyett, hogy véletlenszerű klipeket címkézne fel.

Az e-kereskedelmi katalógusok bizottságonkénti lekérdezések segítségével választják ki azokat a termékképeket, amelyeknél több osztályozó nem ért egyet, és előnyben részesíti azokat a kézi kategóriacímkézés során.

Kockázatok és védőkorlátok

A különböző csapatok eltérően használhatják ugyanazt a kifejezést, ezért korán határozza meg a hatókört.

A benchmarkok erősnek tűnhetnek, miközben a valós teljesítmény egyenetlen.

Az adatminőségi és értékelési tervek figyelmen kívül hagyása gyakran törékeny eredményekhez vezet.

Végrehajtási ütemterv

1

Kezdje a kívánt eredmény egyszerű nyelvű meghatározásával.

2

A tesztelés előtt válasszon egy sikermutatót és egy hibafeltételt.

3

Futtasson egy kis pilotot reprezentatív adatokkal, ne egy csiszolt demókészlettel.

4

Dokumentálja, hol segít az aktív tanulás, és hol jobbak az egyszerűbb módszerek.

Folytassa a felfedezést

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Active Learning quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Kezdő kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Gyakran ismételt kérdések

What is Active Learning?

Az aktív tanulás egy olyan képzési stratégia, ahol a modell maga választja ki, hogy az ember mely címkézetlen példákat jelölje meg legközelebb. Ez azért fontos, mert a címkézési adatok drágák, és az intelligens kiválasztás a megjegyzések töredékével nagy pontosságot érhet el.

Mi az aktív tanulás fő célja?

Az aktív tanulás célja a modell teljesítményének maximalizálása a megjelölt példákonként azáltal, hogy kiválasztja a leginkább informatív pontokat, amelyeket az ember megjegyzésekkel lát el.

Az aktív tanulásban mi az „orákulum”?

Az orákulum az a címkézési forrás – általában egy humán szakértő –, amelyből a modell lekérdezi a kiválasztott példákon az igazság címkéit.

Melyik stratégia választja ki azokat a példákat, amelyekben a modell a legkevésbé magabiztos?

A bizonytalansági mintavétel olyan pontokat választ ki, ahol a modell előrejelzett valószínűségei a legközelebb állnak a találgatáshoz, például magas entrópia vagy kis különbség a felső osztályok között.

Hogyan dönti el bizottságonkénti lekérdezés, hogy mely példákat jelölje meg?

A bizottságonkénti lekérdezés egy együttest képez, és azokat a pontokat helyezi előtérbe, ahol a tagok nem értenek egyet, mivel az egyet nem értés informatív régiókat jelez.

Mi a fő kockázata annak, ha csak a bizonytalansági mintavételre hagyatkozunk?

A bizonytalan pontok mohó hajszolása túlzottan összpontosíthat egy régióra, és elmulaszthat másokat, ezért gyakran adnak hozzá sokféleséget vagy kötegelt módszereket.