Next-Token Prediction
Предсказването на следващ токен е измамно простата цел зад моделите в стил GPT: предвид всичко дотук, познайте следващата част от текста.
Преглед
Repeated billions of times, this single task produces models that write, reason, and converse.
Дълбоко гмуркане
Предсказването на следващ токен обучава модел за присвояване на вероятности на следващия токен, даден на всички предходни токени. Текстът първо се разбива на токени (части поддуми) от токенизатор като кодиране с двойка байтове. Трансформатор само с декодер чете последователността отляво надясно и извежда вероятностно разпределение върху целия речник за следващата позиция. По време на обучението на модела се показват масивни текстови корпуси и се наказва всеки път, когато присвои ниска вероятност на действителния следващ токен. По време на генериране моделът взема проби или алчно избира токен, добавя го и повтаря този цикъл авторегресивно. Тази единствена цел се мащабира забележително: GPT-2, GPT-3 и наследниците са научили граматика, факти, превод и разсъждения само като са станали много добри в предвиждането на следващия знак.
Техническа информация
Ключовият механизъм е причинно (маскирано) самовнимание: когато прогнозира позиция N, моделът може да обръща внимание само на позиции 1 до N-1, никога на бъдещето. Изходният слой проектира крайното скрито състояние върху речника и прилага softmax, за да получи вероятности. Обучението минимизира кръстосаната ентропия, еквивалентно на увеличаване на вероятността за наблюдавания текст. Контролите за вземане на проби като температура и top-p променят това разпределение при извода, за да заменят креативността срещу надеждността.
Стратегическо въздействие
Speed and scale
Езиковите работни процеси могат да се движат по-бързо, без да се жертва последователността.
Access and reach
Той разширява достъпа между езици и стилове на комуникация.
Clearer decisions
Екипите могат да отделят повече време за преценка, докато автоматизацията се справя с повторението.
Бъдещето на прогнозирането на следващия токен
Предсказването на следващ токен е в основата на всички модерни големи езикови модели и ще остане гръбнакът на генеративния AI. Изследванията го разширяват с по-дълги контекстни прозорци, спекулативно и паралелно декодиране за скорост и цели за прогнозиране на множество токени, които отгатват няколко бъдещи токена наведнъж. Подсилване на обучението от човешките слоеве за обратна връзка отгоре за подравняване на резултатите. Границата прави същата проста цел по-евтина, по-бърза и по-контролируема във все по-голям мащаб.
Внедряване в реалния свят
Захранване на ChatGPT и подобни асистенти за генериране на разговорни отговори един токен наведнъж.
Автоматично довършване и предложения за код в инструменти като GitHub Copilot, докато пишете.
Изготвяне на имейли, статии и маркетингово копие от кратка подкана.
Генериране на текст в реално време в асистенти за писане, които завършват вашите изречения.
Рискове и предпазни огради
Халюцинираните факти могат тихо да влязат в отчети, потоци за поддръжка или резултати от изследвания.
Бързата чувствителност може да създаде противоречиви резултати при подобни заявки.
Чувствителните текстови данни могат да бъдат разкрити, ако контролите за достъп са слаби.
Пътна карта за изпълнение
Определете изходен формат, тон и стандарти за качество преди внедряване.
Наземни отговори с доверени източници винаги, когато точността има значение.
Поддържайте контролна точка за човешки преглед за изходи с високи залози.
Проследявайте моделите на неуспехи и редовно обучавайте подкани или работни потоци.
Продължете да изследвате
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Next-Token Prediction quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Обучение за прогнозиране на множество токени
Frequently asked questions
What is Next-Token Prediction?
Предсказването на следващ токен е измамно простата цел зад моделите в стил GPT: предвид всичко дотук, познайте следващата част от текста. Повтаряна милиарди пъти, тази единствена задача създава модели, които пишат, разсъждават и разговарят.
Какво извежда моделът за прогнозиране на следващ токен на всяка стъпка?
Моделът създава вероятност за всеки възможен следващ токен, след което един се избира чрез извадка или алчен избор.
Какъв тип внимание използва декодер в стил GPT?
Причинно-следственото маскиране гарантира, че позиция N може да вижда само позициите преди нея, запазвайки настройката за предвиждане отляво надясно.
Какво означава „авторегресивно“ генериране тук?
Авторегресивното генериране произвежда един токен, добавя го към контекста и повтаря цикъла.
Коя функция на загубата обикновено се свежда до минимум по време на обучение?
Крос-ентропията наказва модела за присвояване на ниска вероятност на истинския следващ токен, еквивалентно на максимизиране на вероятността.
Какво прави повишаването на температурата по време на вземане на проби?
По-високата температура изравнява разпределението на вероятностите, увеличавайки случайността; по-ниската температура прави избора по-консервативен.