PODSTAWOWY PRZEWODNIK

Krzywe ROC i AUC

Krzywa ROC przedstawia, jak dobrze klasyfikator oddziela dwie klasy w ramach każdego możliwego progu decyzyjnego, a AUC kompresuje całą krzywą w jedną liczbę.

2 minuty czytaniaOstatnia aktualizacja

Przegląd

Together they tell you ranking quality independent of where you draw the cutoff.

Głębokie nurkowanie

Krzywa charakterystyki operacyjnej odbiornika (ROC) przedstawia współczynnik prawdziwie dodatni (czułość, na osi y) względem współczynnika fałszywie dodatniego (1 minus specyficzność, na osi x) w miarę przesuwania progu klasyfikacji od 1 w dół do 0. Każdy próg daje jeden punkt; połączenie ich wyznacza krzywą. Model, w którym każdy pozytyw jest wyższy od wszystkich negatywów, znajduje się w lewym górnym rogu. Pole pod krzywą (AUC) mierzy całkowite pole pod tą linią w zakresie od 0,5 (losowe zgadywanie, przekątna) do 1,0 (idealnie). Przydatna interpretacja: AUC równa się prawdopodobieństwu, że model uzyska losowo wybrany wynik pozytywny wyższy niż losowo wybrany wynik negatywny. Termin pochodzi od operatorów radarów z czasów II wojny światowej, którzy odróżniali sygnał od szumu.

Wgląd techniczny

Wartość AUC jest niezależna od progu, ponieważ integruje wydajność we wszystkich wartościach odcięcia, zatem nie ma na nią wpływu miejsce ustawienia granicy decyzyjnej. Jest matematycznie odpowiednikiem statystyki U Manna-Whitneya i testu sumy rang Wilcoxona, co oznacza, że ​​zależy tylko od kolejności rang przewidywanych wyników, a nie od ich wartości bezwzględnych. Dzięki temu jest on stabilny w przypadku monotonicznych transformacji wyniku, ale także niewrażliwy na kalibrację: dobrze oceniony, ale słabo skalibrowany model nadal może uzyskać wysoką wartość AUC.

Wpływ strategiczny

Jaśniejsze decyzje

Pomaga oddzielić jasne twierdzenia techniczne od języka marketingowego.

Koszt i budżet

Możesz zadawać pytania dotyczące lepszego wdrożenia, zanim wydasz pieniądze lub czas.

Zespół i przepływ pracy

Zespoły charakteryzujące się wspólnym zrozumieniem podejmują lepsze decyzje dotyczące produktów, zasad i uczenia się.

Przyszłość krzywych ROC i AUC

ROC-AUC pozostaje domyślnym miernikiem raportowania, ale praktycy coraz częściej łączą go z krzywymi Precision-Recall w przypadku silnie niezrównoważonych danych, gdzie ROC może wyglądać zwodniczo optymistycznie. Należy spodziewać się szerszego przyjęcia częściowego AUC (koncentrującego się na regionie o niskim wskaźniku wyników fałszywie dodatnich, który ma znaczenie operacyjne), analizy uwzględniającej koszty i analizy krzywych decyzyjnych oraz raportowania AUC dla poszczególnych podgrup w celu wykrycia luk w sprawiedliwości. Ponieważ modele stanowią podstawę do podejmowania rzeczywistych decyzji, wskaźniki kalibracji i AUC będą coraz częściej podawane obok siebie, a nie same AUC.

Implementacja w świecie rzeczywistym

Porównanie dwóch modeli wykrywania oszustw banku na podstawie ich AUC w celu wybrania tego, który najlepiej plasuje transakcje oszukańcze nad transakcjami legalnymi

Ocena testu diagnostycznego pod kątem choroby (np. klasyfikatora badań przesiewowych w kierunku raka), w przypadku którego radiolodzy muszą zrezygnować z wychwytywania większej liczby przypadków na rzecz fałszywych alarmów

Dostrajanie progu filtra spamu za pomocą krzywej ROC, aby utrzymać bardzo niski poziom fałszywych alarmów (prawdziwa poczta oznaczona jako spam)

Porównanie modelu scoringowego niespłacania kredytu, w którym AUC podsumowuje, jak dobrze oddziela kredytobiorców, którzy spłacają, od tych, którzy nie wywiązują się ze zobowiązań

Zagrożenia i poręcze

Różne zespoły mogą odmiennie używać tego samego terminu, dlatego należy wcześniej zdefiniować zakres.

Testy porównawcze mogą wyglądać dobrze, podczas gdy wydajność w świecie rzeczywistym jest nierówna.

Ignorowanie planów dotyczących jakości danych i oceny często skutkuje kruchymi wynikami.

Plan wdrożenia

1

Zacznij od jasnej definicji potrzebnego wyniku.

2

Przed testowaniem wybierz jedną metrykę sukcesu i jeden warunek niepowodzenia.

3

Przeprowadź mały pilotaż z reprezentatywnymi danymi, a nie dopracowanym zestawem demonstracyjnym.

4

Dokumentuj, gdzie pomagają krzywe ROC i AUC, a gdzie prostsze metody są lepsze.

Odkrywaj dalej

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the ROC Curves and AUC quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Rozpocznij quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Następny poradnik

Kompromis odchylenia i wariancji

Często zadawane pytania

What is ROC Curves and AUC?

Krzywa ROC przedstawia, jak dobrze klasyfikator oddziela dwie klasy w ramach każdego możliwego progu decyzyjnego, a AUC kompresuje całą krzywą w jedną liczbę. Razem informują Cię o rankingu jakości niezależnie od tego, gdzie narysujesz granicę.

Jakie dwie wielkości wykreśla względem siebie krzywa ROC?

Krzywa ROC przedstawia odsetek rzeczywiście dodatnich wyników (czułość) na osi y względem częstości wyników fałszywie dodatnich (1 – specyficzność) na osi x w poprzek progów.

Jaka wartość AUC odpowiada klasyfikatorowi, który nie działa lepiej niż zgadywanie losowe?

Losowy klasyfikator śledzi linię ukośną, dając AUC wynoszące 0,5. AUC wynoszące 1,0 jest idealne, a 0,0 oznacza, że ​​każdy ranking jest dokładnie odwrotny.

Dlaczego AUC określa się jako „niezależne od progu”?

AUC podsumowuje całą krzywą ROC, która jest generowana przez przemiatanie każdego progu, więc nie zależy od żadnego wybranego punktu odcięcia.

Która krzywa jest często zalecana obok lub zamiast ROC w przypadku silnie niezrównoważonego zbioru danych, ponieważ ROC może wyglądać zbyt optymistycznie?

W przypadku problemów rzadko dodatnich duża liczba prawdziwych negatywów utrzymuje niski współczynnik wyników fałszywie dodatnich, zawyżając ROC. Krzywe Precision-Recall skupiają się na klasie pozytywnej i uczciwiej ujawniają wydajność.