PRZEWODNIK techniczny

Funkcje wpływu na atrybucję danych szkoleniowych

Funkcje wpływu szacują, w jakim stopniu każdy przykład szkoleniowy wpłynął na przewidywanie modelu, umożliwiając prześledzenie danych wyjściowych z powrotem do danych, które je spowodowały.

2 minuty czytaniaOstatnia aktualizacja

Przegląd

Mają znaczenie, ponieważ zamieniają nieprzejrzysty model w coś, co można audytować pod kątem praw autorskich, debugowania i zaufania.

Głębokie nurkowanie

Funkcje wpływu pochodzą z solidnych statystyk i zostały zaadaptowane do głębokiego uczenia się przez Koha i Lianga w 2017 r. Podstawowe pytanie jest kontrfaktyczne: jak zmieniłaby się strata modelu w punkcie testowym, gdyby konkretny przykład szkoleniowy został usunięty lub wzmocniony? Zamiast faktycznie przekwalifikowywać (co jest beznadziejnie kosztowne), funkcje wpływu przybliżają tę zmianę za pomocą rachunku różniczkowego. Obliczają gradient straty dla punktu treningowego i punktu testowego, a następnie łączą je poprzez odwrotność Hessianu straty, która oddaje krzywiznę przestrzeni parametrów modelu. Duży pozytywny wpływ oznacza, że ​​przykład szkoleniowy popchnął model w stronę przewidywań; duża wartość ujemna oznacza, że ​​został na nią popchnięty. Rezultatem jest rankingowa lista najbardziej odpowiedzialnych przykładów szkoleń.

Wgląd techniczny

Dokładny wzór wymaga odwrotności Hesja straty po wszystkich parametrach, co jest trudne do rozwiązania w przypadku modeli miliardowych parametrów. Praktycy przybliżają to metodami takimi jak LiSSA (stochastyczna inwersja iteracyjna), krzywizna współczynnika Kroneckera (EK-FAC) lub losowe projekcje, takie jak TRAK. W swojej pracy Anthropic z 2023 r. skalowano funkcje wpływu do dużych modeli językowych przy użyciu EK-FAC, ujawniając, że wpływowe przykłady często mają wspólne abstrakcyjne wzorce, a nie dokładne, powierzchowne sformułowania.

Wpływ strategiczny

Koszt i budżet

Decyzje dotyczące architektury wpływają na wydajność i koszty operacyjne przez lata.

Jaśniejsze decyzje

Edukacja techniczna pomaga zespołom wybrać odpowiedni stos, a nie tylko najnowszy.

Kontrola jakości

Lepsze wybory inżynieryjne zmniejszają liczbę incydentów związanych z niezawodnością w produkcji.

Przyszłość funkcji wpływu w atrybucji danych szkoleniowych

Oczekuj, że atrybucja oparta na wpływach stanie się infrastrukturą odpowiedzialności za sztuczną inteligencję. Organy regulacyjne i sądy sprawdzające, czy tekst chroniony prawem autorskim ukształtował wynik, będą chciały uzyskać pochodzenie na poziomie przykładu, a programiści wykorzystają je do wykrycia błędnie oznaczonych lub zatrutych danych. Tańsze przybliżenia, takie jak TRAK i szkicowanie gradientowe, przesuwają atrybucję w czasie rzeczywistym, a połączenie jej z oduczaniem się może pozwolić zespołom usunąć wpływ dokumentu bez pełnego przeszkolenia.

Implementacja w świecie rzeczywistym

Śledzenie, które książki chronione prawem autorskim miały największy wpływ na fragment wygenerowany przez model językowy, na potrzeby analizy prawnej i licencyjnej

Debugowanie błędnej klasyfikacji poprzez wyświetlenie błędnie oznakowanych obrazów szkoleniowych, które popchnęły model w kierunku błędnej odpowiedzi

Wykrywanie zatrutych lub anomalnych przykładów treningowych, które wywierają nadmierny wpływ na określone przewidywania

Audyt modelu kredytowego lub zatrudnienia w celu wykazania, które zapisy historyczne wpłynęły na kwestionowaną decyzję

Zagrożenia i poręcze

Optymalizacja jednego testu porównawczego może ukryć szersze słabości systemu.

Koszty infrastruktury i utrzymania są często niedoszacowane.

W miarę jak systemy stają się coraz bardziej złożone, luki w bezpieczeństwie i obserwowalności mogą się zwiększać.

Plan wdrożenia

1

Przed wdrożeniem zdefiniuj docelowe opóźnienia, jakość i koszty.

2

Test porównawczy w realistycznych warunkach obciążenia i danych.

3

Monitorowanie przyrządu pod kątem błędów, dryftu i wpływu użytkownika.

4

Przed skalowaniem przygotuj ścieżki wycofywania zmian i reakcji na incydenty.

Odkrywaj dalej

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Influence Functions for Training Data Attribution quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Rozpocznij quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Następny poradnik

W pełni podzielone dane równolegle

Często zadawane pytania

Czym są funkcje wpływu dla atribucji danych treningowych?

Funkcje wpływu szacują, w jakim stopniu każdy przykład szkoleniowy wpłynął na przewidywanie modelu, umożliwiając prześledzenie danych wyjściowych z powrotem do danych, które je spowodowały. Mają znaczenie, ponieważ zmieniają nieprzejrzysty model w coś, co można sprawdzić pod kątem praw autorskich, debugowania i zaufania.

Jakie pytanie alternatywne przybliża funkcje wpływające?

Funkcje wpływu szacują wpływ zakłócenia wagi przykładowego treningu na stratę w punkcie testowym, co w przybliżeniu oznacza przekwalifikowanie bez wykonywania tego.

Który obiekt matematyczny utrudnia dokładne obliczenie wpływu w przypadku dużych modeli?

Klasyczny wzór na wpływ wymaga odwrócenia hesjanu po wszystkich parametrach, co jest niewykonalne w przypadku modeli o miliardach parametrów.

Kto zaadaptował funkcje wpływu do współczesnego głębokiego uczenia się w dobrze znanym artykule z 2017 roku?

W artykule Pang Wei Koha i Percy’ego Lianga z 2017 r. „Zrozumienie przewidywań czarnej skrzynki za pomocą funkcji wpływu” wprowadzono tę technikę do głębokiego uczenia się.

Co oznacza duża NEGATYWNA wartość wpływu?

Negatywny wpływ oznacza zwiększenie wagi tego przykładu szkoleniowego, co zmniejszyłoby pewność modelu co do przewidywań, tj. byłoby sprzeczne z wynikami.

Jakiego przybliżenia użył Anthropic do skalowania funkcji wpływu do dużych modeli językowych?

W badaniu Anthropic z 2023 r. wykorzystano EK-FAC do przybliżenia odwrotności hesja, umożliwiając analizę wpływu na duże modele językowe.