PODSTAWOWY PRZEWODNIK

Aktywna nauka

Aktywne uczenie się to strategia szkoleniowa, w której model sam wybiera, które nieoznakowane przykłady człowiek powinien oznaczyć jako następne.

2 minuty czytaniaOstatnia aktualizacja

Przegląd

It matters because labeling data is expensive, and smart selection can reach high accuracy with a fraction of the annotations.

Głębokie nurkowanie

Większość uczenia się nadzorowanego zakłada, że ​​masz już duży stos oznaczonych etykietami danych. Aktywne uczenie się odwraca tę sytuację: zaczynasz od małego zestawu opatrzonego etykietą i dużej puli nieoznaczonych przykładów, a następnie wielokrotnie prosisz człowieka („wyrocznię”) o oznaczenie tylko tych, które zawierają najwięcej informacji. Model jest szkolony, używany do oceny puli nieoznakowanej, a przykłady o najwyższej wartości są wysyłane do etykietowania — następnie pętla się powtarza. Typowe strategie selekcji obejmują próbkowanie niepewności (wybór przykładów, co do których model ma najmniejszą pewność), zapytanie przez komisję (wybór w przypadku, gdy zespół się nie zgadza) i próbkowanie zróżnicowane (obejmuje różne obszary danych). Dobrze wykonane, aktywne uczenie się może dorównać dokładności całego zbioru danych przy użyciu znacznie mniejszej liczby etykiet, dlatego jest popularne w obrazowaniu medycznym, NLP i każdej dziedzinie, w której adnotacje eksperckie są powolne lub kosztowne.

Wgląd techniczny

Podstawową ideą jest oszacowanie „wartości” każdego nieoznakowanego punktu przed zapłaceniem za jego oznaczenie. Próbkowanie z niepewnością wykorzystuje własne prawdopodobieństwa modelu — na przykład wybiera punkt, którego prawdopodobieństwo najwyższej klasy jest najbliższe prawdopodobieństwu lub z największą entropią lub najmniejszym marginesem między dwiema górnymi klasami. Zapytanie przez komisję szkoli kilka modeli i wybiera punkty, w których najbardziej się nie zgadzają. Kluczowym ryzykiem jest błąd w próbkowaniu: zachłanne pogoń za niepewnością może zignorować całe regiony, dlatego często łączone są metody oparte na różnorodności lub świadomości wsadowej.

Wpływ strategiczny

Jaśniejsze decyzje

Pomaga oddzielić jasne twierdzenia techniczne od języka marketingowego.

Koszt i budżet

Możesz zadawać pytania dotyczące lepszego wdrożenia, zanim wydasz pieniądze lub czas.

Zespół i przepływ pracy

Zespoły charakteryzujące się wspólnym zrozumieniem podejmują lepsze decyzje dotyczące produktów, zasad i uczenia się.

Przyszłość aktywnego uczenia się

Aktywne uczenie się jest coraz częściej łączone z dużymi, wstępnie wyszkolonymi i podstawowymi modelami, w których cel przesuwa się z etykietowania wszystkiego na tanie dostrajanie na kilku przykładach o dużej wartości. Spodziewaj się ściślejszej integracji ze słabym nadzorem, samonadzorowanym szkoleniem wstępnym i narzędziami typu „człowiek w pętli”, które sugerują recenzentom etykiety do potwierdzenia, a nie tworzenia. Ponieważ w wielu rzeczywistych wdrożeniach dominują koszty etykietowania, automatyczna selekcja i wydajne interfejsy do adnotacji pozostaną kluczowymi elementami budowania modeli w wyspecjalizowanych dziedzinach, w których brakuje danych, takich jak medycyna i prawo.

Implementacja w świecie rzeczywistym

Zespół radiologów szkoli detektor nowotworów, każąc modelowi oznaczać najbardziej niejednoznaczne skany, aby eksperci radiologowie mogli je oznaczyć, co radykalnie skraca czas przeznaczony na adnotacje.

System spamu lub moderacji treści ujawnia wiadomości graniczne, co do których weryfikatorzy nie mają najmniejszej pewności, najszybciej poprawiając się w trudnych przypadkach.

Firma zajmująca się rozpoznawaniem mowy wybiera klipy audio, których model jest najbardziej niepewny (akcenty, szum), i wysyła do transkrypcji, zamiast oznaczać losowe klipy etykietami.

Katalog e-commerce korzysta z zapytań poszczególnych komisji, aby wybrać zdjęcia produktów, w przypadku których wiele klasyfikatorów nie zgadza się z tym, nadając im priorytet w celu ręcznego oznaczania kategorii.

Zagrożenia i poręcze

Różne zespoły mogą odmiennie używać tego samego terminu, dlatego należy wcześniej zdefiniować zakres.

Testy porównawcze mogą wyglądać dobrze, podczas gdy wydajność w świecie rzeczywistym jest nierówna.

Ignorowanie planów dotyczących jakości danych i oceny często skutkuje kruchymi wynikami.

Plan wdrożenia

1

Zacznij od jasnej definicji potrzebnego wyniku.

2

Przed testowaniem wybierz jedną metrykę sukcesu i jeden warunek niepowodzenia.

3

Przeprowadź mały pilotaż z reprezentatywnymi danymi, a nie dopracowanym zestawem demonstracyjnym.

4

Dokumentuj, gdzie aktywne uczenie się pomaga i gdzie prostsze metody są lepsze.

Odkrywaj dalej

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Active Learning quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Rozpocznij quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Następny poradnik

Głębokie uczenie się

Często zadawane pytania

What is Active Learning?

Aktywne uczenie się to strategia szkoleniowa, w której model sam wybiera, które nieoznakowane przykłady człowiek powinien oznaczyć jako następne. Ma to znaczenie, ponieważ etykietowanie danych jest drogie, a inteligentna selekcja może osiągnąć wysoką dokładność przy ułamku adnotacji.

Jaki jest główny cel aktywnego uczenia się?

Aktywne uczenie się ma na celu maksymalizację wydajności modelu na oznaczony przykład poprzez wybór punktów najbardziej informacyjnych, które człowiek może opisać.

Czym jest „wyrocznia” w aktywnym uczeniu się?

Wyrocznia jest źródłem etykietowania — zwykle ekspertem w postaci człowieka — od którego model odpytuje o etykiety oparte na faktach na wybranych przykładach.

Która strategia wybiera przykłady, co do których model jest najmniej pewny?

Próbkowanie z niepewnością wybiera punkty, w których prawdopodobieństwa przewidywane przez model są najbliższe szacunkom, np. wysoka entropia lub mały margines między najwyższymi klasami.

W jaki sposób zapytania przez komisję decydują, które przykłady oznaczyć etykietą?

Zapytanie po komisji szkoli zespół i ustala priorytety punktów, w których członkowie się nie zgadzają, ponieważ brak zgody sygnalizuje obszary informacyjne.

Jakie jest główne ryzyko polegające na poleganiu wyłącznie na próbkowaniu z niepewnością?

Chciwe pogoń za niepewnymi punktami może spowodować nadmierne skupienie się na jednym regionie i pominięcie innych, dlatego często dodaje się metody różnorodności lub świadomości wsadowej.