PRZEWODNIK Językowy AI

Przewidywanie następnego tokenu

Przewidywanie następnego tokenu to zwodniczo prosty cel modeli w stylu GPT: biorąc pod uwagę wszystko do tej pory, odgadnij następny fragment tekstu.

2 minuty czytaniaOstatnia aktualizacja

Przegląd

Repeated billions of times, this single task produces models that write, reason, and converse.

Głębokie nurkowanie

Przewidywanie następnego tokenu uczy model przypisywania prawdopodobieństw do następnego tokenu, biorąc pod uwagę wszystkie poprzednie tokeny. Tekst jest najpierw dzielony na tokeny (fragmenty podsłów) za pomocą tokenizatora, takiego jak kodowanie par bajtów. Transformator przeznaczony tylko do dekodera odczytuje sekwencję od lewej do prawej i generuje rozkład prawdopodobieństwa w całym słownictwie dla następnej pozycji. Podczas uczenia modelowi pokazywane są ogromne korpusy tekstowe i karane za każdym razem, gdy przypisze niskie prawdopodobieństwo do rzeczywistego następnego tokena. W czasie generowania model próbkuje lub zachłannie wybiera token, dołącza go i powtarza tę pętlę autoregresywnie. Ten jeden cel jest niezwykle skalowalny: GPT-2, GPT-3 i następcy, wszyscy nauczyli się gramatyki, faktów, tłumaczenia i rozumowania wyłącznie dzięki temu, że byli bardzo dobrzy w przewidywaniu następnego tokena.

Wgląd techniczny

Kluczowym mechanizmem jest przyczynowa (zamaskowana) samouważność: podczas przewidywania pozycji N model może uwzględniać tylko pozycje od 1 do N-1, nigdy przyszłość. Warstwa wyjściowa rzutuje ostateczny stan ukryty na słownictwo i stosuje funkcję softmax w celu uzyskania prawdopodobieństw. Uczenie minimalizuje entropię krzyżową, co jest równoznaczne z maksymalizacją prawdopodobieństwa zaobserwowanego tekstu. Kontrole próbkowania, takie jak temperatura i top-p, zmieniają ten rozkład na podstawie wnioskowania, rezygnując z kreatywności z niezawodnością.

Wpływ strategiczny

Szybkość i skala

Przepływy pracy związane z językiem mogą przebiegać szybciej bez utraty spójności.

Dostęp i zasięg

Rozszerza dostęp w różnych językach i stylach komunikacji.

Jaśniejsze decyzje

Zespoły mogą spędzać więcej czasu na ocenie, podczas gdy automatyzacja radzi sobie z powtarzalnością.

Przyszłość przewidywania następnego tokenu

Przewidywanie następnego tokenu stanowi podstawę wszystkich współczesnych modeli dużych języków i pozostanie podstawą generatywnej sztucznej inteligencji. Badania rozszerzają go o dłuższe okna kontekstowe, dekodowanie spekulatywne i równoległe pod kątem szybkości oraz cele przewidywania wielu tokenów, które odgadują kilka przyszłych tokenów jednocześnie. Wzmocnienie uczenia się z warstw informacji zwrotnych od ludzi na górze, aby dopasować wyniki. Granica sprawia, że ​​ten sam prosty cel staje się tańszy, szybszy i łatwiejszy do kontrolowania na coraz większą skalę.

Implementacja w świecie rzeczywistym

Umożliwianie ChatGPT i podobnym asystentom generowania odpowiedzi konwersacyjnych po jednym tokenie na raz.

Autouzupełnianie i sugestie kodu w narzędziach takich jak GitHub Copilot podczas pisania.

Tworzenie e-maili, artykułów i tekstów marketingowych na podstawie krótkiego podpowiedzi.

Generowanie tekstu w czasie rzeczywistym w asystentach pisania, które kończą Twoje zdania.

Zagrożenia i poręcze

Halucynacyjne fakty mogą po cichu trafiać do raportów, strumieni wsparcia lub wyników badań.

Szybka czułość może spowodować niespójne wyniki w przypadku podobnych żądań.

Wrażliwe dane tekstowe mogą zostać ujawnione, jeśli kontrola dostępu jest słaba.

Plan wdrożenia

1

Zdefiniuj format wyjściowy, ton i standardy jakości przed wdrożeniem.

2

Zawsze, gdy liczy się dokładność, korzystaj z zaufanych źródeł.

3

Utrzymuj punkt kontrolny weryfikacji ręcznej w przypadku wyników o wysokiej stawce.

4

Śledź wzorce niepowodzeń i regularnie powtarzaj monity lub przepływy pracy.

Odkrywaj dalej

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Next-Token Prediction quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Rozpocznij quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Następny poradnik

Szkolenie w zakresie przewidywania wielu tokenów

Często zadawane pytania

What is Next-Token Prediction?

Przewidywanie następnego tokenu to zwodniczo prosty cel modeli w stylu GPT: biorąc pod uwagę wszystko do tej pory, odgadnij następny fragment tekstu. To pojedyncze zadanie, powtarzane miliardy razy, tworzy modele, które piszą, rozumują i rozmawiają.

Co generuje model przewidywania następnego tokenu na każdym kroku?

Model oblicza prawdopodobieństwo każdego możliwego kolejnego żetonu, a następnie jeden jest wybierany poprzez próbkowanie lub zachłanny wybór.

Jakiego rodzaju uwagi używa dekoder w stylu GPT?

Maskowanie przyczynowe zapewnia, że ​​pozycja N widzi tylko pozycje znajdujące się przed nią, zachowując konfigurację przewidywania od lewej do prawej.

Co oznacza tu pokolenie „autoregresywne”?

Generowanie autoregresyjne tworzy jeden token, dodaje go do kontekstu i powtarza pętlę.

Jaka funkcja straty jest zwykle minimalizowana podczas uczenia?

Entropia krzyżowa karze model za przypisanie niskiego prawdopodobieństwa prawdziwemu następnemu tokenowi, co jest równoznaczne z maksymalizacją prawdopodobieństwa.

Co powoduje podniesienie temperatury podczas pobierania próbek?

Wyższa temperatura spłaszcza rozkład prawdopodobieństwa, zwiększając losowość; niższa temperatura sprawia, że ​​wybory są bardziej konserwatywne.