Predikce dalšího tokenu
Predikce dalšího tokenu je zdánlivě jednoduchým cílem modelů ve stylu GPT: vzhledem ke všemu, co zatím bylo, hádejte další kus textu.
Přehled
Repeated billions of times, this single task produces models that write, reason, and converse.
Hluboký ponor
Predikce dalšího tokenu trénuje model tak, aby přiřazoval pravděpodobnosti dalšímu tokenu vzhledem ke všem předchozím tokenům. Text je nejprve rozdělen na tokeny (části podslov) pomocí tokenizeru, jako je kódování po páru bajtů. Transformátor pouze s dekodérem čte sekvenci zleva doprava a vydává rozložení pravděpodobnosti v celém slovníku pro další pozici. Během tréninku se modelu zobrazují masivní textové korpusy a jsou penalizovány, kdykoli přiřadí nízkou pravděpodobnost skutečnému dalšímu tokenu. V době generování model vzorkuje nebo nenasytně vybírá token, připojuje jej a tuto smyčku autoregresivně opakuje. Tento jeden cíl je pozoruhodně škálovatelný: GPT-2, GPT-3 a nástupci se všichni naučili gramatiku, fakta, překlady a uvažování čistě díky tomu, že byli velmi dobří v předpovídání dalšího tokenu.
Technický přehled
Klíčovým mechanismem je kauzální (maskovaná) sebepozornost: při predikci pozice N se model může věnovat pouze pozicím 1 až N-1, nikdy ne budoucnosti. Výstupní vrstva promítne konečný skrytý stav do slovní zásoby a použije softmax k získání pravděpodobností. Školení minimalizuje křížovou entropii, což je ekvivalentní maximalizaci pravděpodobnosti pozorovaného textu. Vzorkovací ovládací prvky, jako je teplota a top-p přetvářejí toto rozdělení na základě odvození, aby se kreativita vyrovnala spolehlivosti.
Strategický dopad
Rychlost a měřítko
Jazykové pracovní postupy se mohou pohybovat rychleji, aniž by byla obětována konzistentnost.
Přístup a dosah
Rozšiřuje přístup napříč jazyky a komunikačními styly.
Jasnější rozhodnutí
Týmy mohou strávit více času úsudkem, zatímco automatizace zvládne opakování.
Budoucnost předpovědi dalšího tokenu
Predikce dalšího tokenu je základem v podstatě všech moderních velkých jazykových modelů a zůstane páteří generativní umělé inteligence. Výzkum jej rozšiřuje o delší kontextová okna, spekulativní a paralelní dekódování pro rychlost a cíle predikce více tokenů, které hádají několik budoucích tokenů najednou. Posílení učení z vrstev lidské zpětné vazby nahoře, aby se sladily výstupy. Hranice činí stejný jednoduchý cíl levnějším, rychlejším a lépe ovladatelným ve stále větším měřítku.
Real-World Implementace
Napájení ChatGPT a podobných asistentů pro generování konverzačních odpovědí po jednom tokenu.
Automatické doplňování a návrhy kódu v nástrojích, jako je GitHub Copilot, během psaní.
Vytváření e-mailů, článků a marketingové kopie z krátké výzvy.
Generování textu v reálném čase při psaní asistentů, kteří dokončí vaše věty.
Rizika a zábradlí
Halucinovaná fakta mohou tiše vstupovat do zpráv, podpůrných toků nebo výstupů výzkumu.
Citlivost na výzvy může způsobit nekonzistentní výsledky napříč podobnými požadavky.
Citlivá textová data mohou být vystavena, pokud je řízení přístupu slabé.
Plán implementace
Před zavedením definujte výstupní formát, tón a standardy kvality.
Pozemní reakce s důvěryhodnými zdroji, kdykoli záleží na přesnosti.
Udržujte kontrolní bod lidské kontroly pro vysoce důležité výstupy.
Sledujte vzorce selhání a pravidelně opakujte výzvy nebo pracovní postupy.
Pokračujte v objevování
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Next-Token Prediction quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Další průvodce
Trénink predikce s více tokeny
Často kladené otázky
What is Next-Token Prediction?
Predikce dalšího tokenu je zdánlivě jednoduchým cílem modelů ve stylu GPT: vzhledem ke všemu, co zatím bylo, hádejte další kus textu. Tato jediná úloha, opakovaná miliardkrát, vytváří modely, které píší, uvažují a konverzují.
Co přináší model predikce dalšího tokenu v každém kroku?
Model vytváří pravděpodobnost pro každý další možný žeton, poté je jeden vybrán vzorkováním nebo chamtivým výběrem.
Jaký typ pozornosti používá dekodér ve stylu GPT?
Kauzální maskování zajišťuje, že pozice N může vidět pouze pozice před ní, přičemž zachovává nastavení predikce zleva doprava.
Co zde znamená „autoregresivní“ generace?
Autoregresivní generování vytvoří jeden token, přidá ho do kontextu a opakuje smyčku.
Jaká ztrátová funkce je během tréninku obvykle minimalizována?
Křížová entropie penalizuje model za přiřazení nízké pravděpodobnosti skutečnému dalšímu tokenu, což je ekvivalentní maximalizaci pravděpodobnosti.
Co dělá zvýšení teploty během vzorkování?
Vyšší teplota zplošťuje rozdělení pravděpodobnosti a zvyšuje náhodnost; nižší teplota činí výběr konzervativnějším.