PRZEWODNIK Językowy AI

Uczenie się kontekstowe

Uczenie się kontekstowe to zaskakująca zdolność dużych modeli językowych do podejmowania nowego zadania na podstawie kilku przykładów umieszczonych w podpowiedzi, bez konieczności ponownego szkolenia.

2 minuty czytaniaOstatnia aktualizacja

Przegląd

It is the reason you can 'teach' a model on the fly just by showing it what you want.

Głębokie nurkowanie

Zwykle nauczenie sieci neuronowej nowego zadania oznacza aktualizację jej wag w drodze szkolenia. Uczenie się w kontekście wygląda inaczej: piszesz kilka przykładów bezpośrednio w podpowiedzi („kontekst”), a model wnioskuje o wzorcu i stosuje go do nowych danych wejściowych. Wewnątrz modelu nic się nie zmienia; przykłady po prostu sterują przewidywaniem następnego tokena. Usłyszysz „zero-shot” (tylko instrukcja), „one-shot” (jeden przykład) i „kilka strzałów” (kilka przykładów). To zachowanie zostało spopularyzowane przez GPT-3 w 2020 roku i okazało się, że jest to wyłaniająca się umiejętność: małe modele nie są w stanie tego zrobić, ale powyżej skali obejmującej około 100 miliardów parametrów dokładność podpowiedzi wymagających kilku strzałów gwałtownie rośnie. Model skutecznie nauczył się rozpoznawać i kontynuować wzorce podczas treningu wstępnego, dzięki czemu może ponownie wykorzystać tę umiejętność w momencie wnioskowania.

Wgląd techniczny

Badania nad interpretacją powiązały większość tej zdolności z „głowami indukcyjnymi” — obwodami uwagi, które pojawiają się podczas treningu i dokonują rozmytego dopasowywania przedrostków: skanują wstecz, gdzie pojawił się podobny token, a następnie kopiują to, co po nim nastąpiło. Zatem gdy monit wyświetla „jabłko -> owoc, marchewka -> warzywo”, model dopasowuje strukturę i przewiduje właściwą etykietę dla następnego elementu. Co najważniejsze, podczas wnioskowania nie przepływają żadne gradienty ani nie są aktualizowane wagi. Przykłady po prostu zmieniają kształt aktywacji, które zasilają rozkład prawdopodobieństwa następnego żetonu.

Wpływ strategiczny

Szybkość i skala

Przepływy pracy związane z językiem mogą przebiegać szybciej bez utraty spójności.

Dostęp i zasięg

Rozszerza dostęp w różnych językach i stylach komunikacji.

Jaśniejsze decyzje

Zespoły mogą spędzać więcej czasu na ocenie, podczas gdy automatyzacja radzi sobie z powtarzalnością.

Przyszłość uczenia się kontekstowego

Rozszerzające się okna kontekstowe (obecnie setki tysięcy tokenów) przesuwają uczenie się w kontekście w kierunku systemów „wielu strzałów”, w których dziesiątki lub setki przykładów mogą konkurować z dostrojeniem niektórych zadań bez kosztów szkolenia. Oczekuj ściślejszej integracji z wyszukiwaniem, dzięki czemu odpowiednie przykłady będą pobierane automatycznie i lepszej teorii na temat sytuacji, gdy nauka kontekstowa zakończy się niepowodzeniem lub zostanie rozproszona. Pozostanie to szybki i tani sposób dostosowania modelu, uzupełniający, a nie zastępujący, dostrajanie pod kątem stabilnych zadań o dużej objętości.

Implementacja w świecie rzeczywistym

Podanie chatbotowi trzech przykładowych zgłoszeń pomocy technicznej i ich kategorii, a następnie poproszenie go o zaklasyfikowanie nowego zgłoszenia w ten sam sposób

Pokazywanie modelu drugiego przed/po par niechlujnego tekstu przeformatowanego na czysty JSON, aby konwertował resztę

Wklejenie kilku przykładowych opisów produktów w tonie Twojej marki, aby nowe pasowały do stylu

Demonstracja trudnego matematycznego problemu słownego została przeprowadzona krok po kroku, dzięki czemu model rozwiązuje podobne problemy przy użyciu tego samego formatu rozumowania

Zagrożenia i poręcze

Halucynacyjne fakty mogą po cichu trafiać do raportów, strumieni wsparcia lub wyników badań.

Szybka czułość może spowodować niespójne wyniki w przypadku podobnych żądań.

Wrażliwe dane tekstowe mogą zostać ujawnione, jeśli kontrola dostępu jest słaba.

Plan wdrożenia

1

Zdefiniuj format wyjściowy, ton i standardy jakości przed wdrożeniem.

2

Zawsze, gdy liczy się dokładność, korzystaj z zaufanych źródeł.

3

Utrzymuj punkt kontrolny weryfikacji ręcznej w przypadku wyników o wysokiej stawce.

4

Śledź wzorce niepowodzeń i regularnie powtarzaj monity lub przepływy pracy.

Odkrywaj dalej

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the In-Context Learning quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Rozpocznij quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Często zadawane pytania

What is In-Context Learning?

Uczenie się kontekstowe to zaskakująca zdolność dużych modeli językowych do podejmowania nowego zadania na podstawie kilku przykładów umieszczonych w podpowiedzi, bez konieczności ponownego szkolenia. To jest powód, dla którego możesz „nauczyć” modela w locie, po prostu pokazując mu, czego chcesz.

Co zasadniczo zmienia się wewnątrz modelu podczas uczenia się kontekstowego?

Uczenie się kontekstowe odbywa się wyłącznie na zasadzie wnioskowania. Przykłady w monicie kształtują aktywacje modelu i przewidywania dotyczące następnego tokenu, ale nie są aktualizowane żadne wagi.

Dlaczego uczenie się kontekstowe określa się mianem umiejętności „emergentnej”?

Zdolność ta jest słaba lub nie występuje w małych modelach i gwałtownie rośnie, gdy modele osiągną bardzo dużą skalę, dlatego nazywa się ją wschodzącą.

Który mechanizm wewnętrzny jest najbardziej powiązany z uczeniem się kontekstowym w transformatorach?

Prace nad interpretacją zidentyfikowały głowy indukcyjne – obwody uwagi, które wykrywają, gdzie pojawił się podobny token i kopiują to, co było dalej – jako główny czynnik stymulujący uczenie się w kontekście.