Krzywe ROC i AUC
Krzywa ROC przedstawia, jak dobrze klasyfikator oddziela dwie klasy w ramach każdego możliwego progu decyzyjnego, a AUC kompresuje całą krzywą w jedną liczbę.
Przegląd
Together they tell you ranking quality independent of where you draw the cutoff.
Głębokie nurkowanie
Krzywa charakterystyki operacyjnej odbiornika (ROC) przedstawia współczynnik prawdziwie dodatni (czułość, na osi y) względem współczynnika fałszywie dodatniego (1 minus specyficzność, na osi x) w miarę przesuwania progu klasyfikacji od 1 w dół do 0. Każdy próg daje jeden punkt; połączenie ich wyznacza krzywą. Model, w którym każdy pozytyw jest wyższy od wszystkich negatywów, znajduje się w lewym górnym rogu. Pole pod krzywą (AUC) mierzy całkowite pole pod tą linią w zakresie od 0,5 (losowe zgadywanie, przekątna) do 1,0 (idealnie). Przydatna interpretacja: AUC równa się prawdopodobieństwu, że model uzyska losowo wybrany wynik pozytywny wyższy niż losowo wybrany wynik negatywny. Termin pochodzi od operatorów radarów z czasów II wojny światowej, którzy odróżniali sygnał od szumu.
Wgląd techniczny
Wartość AUC jest niezależna od progu, ponieważ integruje wydajność we wszystkich wartościach odcięcia, zatem nie ma na nią wpływu miejsce ustawienia granicy decyzyjnej. Jest matematycznie odpowiednikiem statystyki U Manna-Whitneya i testu sumy rang Wilcoxona, co oznacza, że zależy tylko od kolejności rang przewidywanych wyników, a nie od ich wartości bezwzględnych. Dzięki temu jest on stabilny w przypadku monotonicznych transformacji wyniku, ale także niewrażliwy na kalibrację: dobrze oceniony, ale słabo skalibrowany model nadal może uzyskać wysoką wartość AUC.
Wpływ strategiczny
Jaśniejsze decyzje
Pomaga oddzielić jasne twierdzenia techniczne od języka marketingowego.
Koszt i budżet
Możesz zadawać pytania dotyczące lepszego wdrożenia, zanim wydasz pieniądze lub czas.
Zespół i przepływ pracy
Zespoły charakteryzujące się wspólnym zrozumieniem podejmują lepsze decyzje dotyczące produktów, zasad i uczenia się.
Przyszłość krzywych ROC i AUC
ROC-AUC pozostaje domyślnym miernikiem raportowania, ale praktycy coraz częściej łączą go z krzywymi Precision-Recall w przypadku silnie niezrównoważonych danych, gdzie ROC może wyglądać zwodniczo optymistycznie. Należy spodziewać się szerszego przyjęcia częściowego AUC (koncentrującego się na regionie o niskim wskaźniku wyników fałszywie dodatnich, który ma znaczenie operacyjne), analizy uwzględniającej koszty i analizy krzywych decyzyjnych oraz raportowania AUC dla poszczególnych podgrup w celu wykrycia luk w sprawiedliwości. Ponieważ modele stanowią podstawę do podejmowania rzeczywistych decyzji, wskaźniki kalibracji i AUC będą coraz częściej podawane obok siebie, a nie same AUC.
Implementacja w świecie rzeczywistym
Porównanie dwóch modeli wykrywania oszustw banku na podstawie ich AUC w celu wybrania tego, który najlepiej plasuje transakcje oszukańcze nad transakcjami legalnymi
Ocena testu diagnostycznego pod kątem choroby (np. klasyfikatora badań przesiewowych w kierunku raka), w przypadku którego radiolodzy muszą zrezygnować z wychwytywania większej liczby przypadków na rzecz fałszywych alarmów
Dostrajanie progu filtra spamu za pomocą krzywej ROC, aby utrzymać bardzo niski poziom fałszywych alarmów (prawdziwa poczta oznaczona jako spam)
Porównanie modelu scoringowego niespłacania kredytu, w którym AUC podsumowuje, jak dobrze oddziela kredytobiorców, którzy spłacają, od tych, którzy nie wywiązują się ze zobowiązań
Zagrożenia i poręcze
Różne zespoły mogą odmiennie używać tego samego terminu, dlatego należy wcześniej zdefiniować zakres.
Testy porównawcze mogą wyglądać dobrze, podczas gdy wydajność w świecie rzeczywistym jest nierówna.
Ignorowanie planów dotyczących jakości danych i oceny często skutkuje kruchymi wynikami.
Plan wdrożenia
Zacznij od jasnej definicji potrzebnego wyniku.
Przed testowaniem wybierz jedną metrykę sukcesu i jeden warunek niepowodzenia.
Przeprowadź mały pilotaż z reprezentatywnymi danymi, a nie dopracowanym zestawem demonstracyjnym.
Dokumentuj, gdzie pomagają krzywe ROC i AUC, a gdzie prostsze metody są lepsze.
Odkrywaj dalej
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the ROC Curves and AUC quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Następny poradnik
Kompromis odchylenia i wariancji
Często zadawane pytania
What is ROC Curves and AUC?
Krzywa ROC przedstawia, jak dobrze klasyfikator oddziela dwie klasy w ramach każdego możliwego progu decyzyjnego, a AUC kompresuje całą krzywą w jedną liczbę. Razem informują Cię o rankingu jakości niezależnie od tego, gdzie narysujesz granicę.
Jakie dwie wielkości wykreśla względem siebie krzywa ROC?
Krzywa ROC przedstawia odsetek rzeczywiście dodatnich wyników (czułość) na osi y względem częstości wyników fałszywie dodatnich (1 – specyficzność) na osi x w poprzek progów.
Jaka wartość AUC odpowiada klasyfikatorowi, który nie działa lepiej niż zgadywanie losowe?
Losowy klasyfikator śledzi linię ukośną, dając AUC wynoszące 0,5. AUC wynoszące 1,0 jest idealne, a 0,0 oznacza, że każdy ranking jest dokładnie odwrotny.
Dlaczego AUC określa się jako „niezależne od progu”?
AUC podsumowuje całą krzywą ROC, która jest generowana przez przemiatanie każdego progu, więc nie zależy od żadnego wybranego punktu odcięcia.
Która krzywa jest często zalecana obok lub zamiast ROC w przypadku silnie niezrównoważonego zbioru danych, ponieważ ROC może wyglądać zbyt optymistycznie?
W przypadku problemów rzadko dodatnich duża liczba prawdziwych negatywów utrzymuje niski współczynnik wyników fałszywie dodatnich, zawyżając ROC. Krzywe Precision-Recall skupiają się na klasie pozytywnej i uczciwiej ujawniają wydajność.