Przewidywanie następnego tokenu
Przewidywanie następnego tokenu to zwodniczo prosty cel modeli w stylu GPT: biorąc pod uwagę wszystko do tej pory, odgadnij następny fragment tekstu.
Przegląd
Repeated billions of times, this single task produces models that write, reason, and converse.
Głębokie nurkowanie
Przewidywanie następnego tokenu uczy model przypisywania prawdopodobieństw do następnego tokenu, biorąc pod uwagę wszystkie poprzednie tokeny. Tekst jest najpierw dzielony na tokeny (fragmenty podsłów) za pomocą tokenizatora, takiego jak kodowanie par bajtów. Transformator przeznaczony tylko do dekodera odczytuje sekwencję od lewej do prawej i generuje rozkład prawdopodobieństwa w całym słownictwie dla następnej pozycji. Podczas uczenia modelowi pokazywane są ogromne korpusy tekstowe i karane za każdym razem, gdy przypisze niskie prawdopodobieństwo do rzeczywistego następnego tokena. W czasie generowania model próbkuje lub zachłannie wybiera token, dołącza go i powtarza tę pętlę autoregresywnie. Ten jeden cel jest niezwykle skalowalny: GPT-2, GPT-3 i następcy, wszyscy nauczyli się gramatyki, faktów, tłumaczenia i rozumowania wyłącznie dzięki temu, że byli bardzo dobrzy w przewidywaniu następnego tokena.
Wgląd techniczny
Kluczowym mechanizmem jest przyczynowa (zamaskowana) samouważność: podczas przewidywania pozycji N model może uwzględniać tylko pozycje od 1 do N-1, nigdy przyszłość. Warstwa wyjściowa rzutuje ostateczny stan ukryty na słownictwo i stosuje funkcję softmax w celu uzyskania prawdopodobieństw. Uczenie minimalizuje entropię krzyżową, co jest równoznaczne z maksymalizacją prawdopodobieństwa zaobserwowanego tekstu. Kontrole próbkowania, takie jak temperatura i top-p, zmieniają ten rozkład na podstawie wnioskowania, rezygnując z kreatywności z niezawodnością.
Wpływ strategiczny
Szybkość i skala
Przepływy pracy związane z językiem mogą przebiegać szybciej bez utraty spójności.
Dostęp i zasięg
Rozszerza dostęp w różnych językach i stylach komunikacji.
Jaśniejsze decyzje
Zespoły mogą spędzać więcej czasu na ocenie, podczas gdy automatyzacja radzi sobie z powtarzalnością.
Przyszłość przewidywania następnego tokenu
Przewidywanie następnego tokenu stanowi podstawę wszystkich współczesnych modeli dużych języków i pozostanie podstawą generatywnej sztucznej inteligencji. Badania rozszerzają go o dłuższe okna kontekstowe, dekodowanie spekulatywne i równoległe pod kątem szybkości oraz cele przewidywania wielu tokenów, które odgadują kilka przyszłych tokenów jednocześnie. Wzmocnienie uczenia się z warstw informacji zwrotnych od ludzi na górze, aby dopasować wyniki. Granica sprawia, że ten sam prosty cel staje się tańszy, szybszy i łatwiejszy do kontrolowania na coraz większą skalę.
Implementacja w świecie rzeczywistym
Umożliwianie ChatGPT i podobnym asystentom generowania odpowiedzi konwersacyjnych po jednym tokenie na raz.
Autouzupełnianie i sugestie kodu w narzędziach takich jak GitHub Copilot podczas pisania.
Tworzenie e-maili, artykułów i tekstów marketingowych na podstawie krótkiego podpowiedzi.
Generowanie tekstu w czasie rzeczywistym w asystentach pisania, które kończą Twoje zdania.
Zagrożenia i poręcze
Halucynacyjne fakty mogą po cichu trafiać do raportów, strumieni wsparcia lub wyników badań.
Szybka czułość może spowodować niespójne wyniki w przypadku podobnych żądań.
Wrażliwe dane tekstowe mogą zostać ujawnione, jeśli kontrola dostępu jest słaba.
Plan wdrożenia
Zdefiniuj format wyjściowy, ton i standardy jakości przed wdrożeniem.
Zawsze, gdy liczy się dokładność, korzystaj z zaufanych źródeł.
Utrzymuj punkt kontrolny weryfikacji ręcznej w przypadku wyników o wysokiej stawce.
Śledź wzorce niepowodzeń i regularnie powtarzaj monity lub przepływy pracy.
Odkrywaj dalej
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Next-Token Prediction quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Następny poradnik
Szkolenie w zakresie przewidywania wielu tokenów
Często zadawane pytania
What is Next-Token Prediction?
Przewidywanie następnego tokenu to zwodniczo prosty cel modeli w stylu GPT: biorąc pod uwagę wszystko do tej pory, odgadnij następny fragment tekstu. To pojedyncze zadanie, powtarzane miliardy razy, tworzy modele, które piszą, rozumują i rozmawiają.
Co generuje model przewidywania następnego tokenu na każdym kroku?
Model oblicza prawdopodobieństwo każdego możliwego kolejnego żetonu, a następnie jeden jest wybierany poprzez próbkowanie lub zachłanny wybór.
Jakiego rodzaju uwagi używa dekoder w stylu GPT?
Maskowanie przyczynowe zapewnia, że pozycja N widzi tylko pozycje znajdujące się przed nią, zachowując konfigurację przewidywania od lewej do prawej.
Co oznacza tu pokolenie „autoregresywne”?
Generowanie autoregresyjne tworzy jeden token, dodaje go do kontekstu i powtarza pętlę.
Jaka funkcja straty jest zwykle minimalizowana podczas uczenia?
Entropia krzyżowa karze model za przypisanie niskiego prawdopodobieństwa prawdziwemu następnemu tokenowi, co jest równoznaczne z maksymalizacją prawdopodobieństwa.
Co powoduje podniesienie temperatury podczas pobierania próbek?
Wyższa temperatura spłaszcza rozkład prawdopodobieństwa, zwiększając losowość; niższa temperatura sprawia, że wybory są bardziej konserwatywne.