PRZEWODNIK Językowy AI

Szkolenie w zakresie przewidywania wielu tokenów

Zamiast przewidywać tylko następny token, model jest szkolony tak, aby przewidywał kilka przyszłych tokenów jednocześnie.

2 minuty czytaniaOstatnia aktualizacja

Przegląd

This sharpens learning signals and unlocks faster inference through self-speculative decoding.

Głębokie nurkowanie

Standardowe modele języka są trenowane z przewidywaniem następnego tokenu: biorąc pod uwagę kontekst, przewiduj pojedynczy następny token. Przewidywanie wielu tokenów (MTP), spopularyzowane w artykule Meta z 2024 r. i przyjęte w DeepSeek-V3, dodaje dodatkowe lekkie głowice wyjściowe, dzięki czemu model jednocześnie przewiduje następny token oraz drugi, trzeci i czwarty token przed nim z tego samego ukrytego stanu. Zmusza to sieć do planowania dalej w przyszłość i zagęszcza sygnał szkoleniowy — każda pozycja powoduje teraz wiele warunków straty. Meta odnotował szczególnie duże korzyści w zakresie kodowania i rozumowania generatywnego, przy czym większe modele odniosły większe korzyści. Co najważniejsze, dodatkowe głowy można wyrzucić po szkoleniu, więc rozmiar modelu podczas wdrażania nie musi się zwiększać.

Wgląd techniczny

MTP przyłącza n niezależnych głowic predykcyjnych na szczycie wspólnej szyny transformatorowej; głowa k przewiduje token na pozycji t+k z reprezentacji na pozycji t. Straty sumowane są w trakcie treningu. Podsumowując, głowice pomocnicze umożliwiają dekodowanie samospekulacyjne: model proponuje kilka tokenów w jednym przebiegu, a następnie je weryfikuje, osiągając nawet około 3x szybszą generację bez zmiany dystrybucji wyjściowej.

Wpływ strategiczny

Szybkość i skala

Przepływy pracy związane z językiem mogą przebiegać szybciej bez utraty spójności.

Dostęp i zasięg

Rozszerza dostęp w różnych językach i stylach komunikacji.

Jaśniejsze decyzje

Zespoły mogą spędzać więcej czasu na ocenie, podczas gdy automatyzacja radzi sobie z powtarzalnością.

Przyszłość szkolenia w zakresie przewidywania wielu tokenów

MTP staje się domyślnym składnikiem pionierskich receptur szkoleniowych, ponieważ poprawia zarówno jakość, jak i szybkość wnioskowania niewielkim kosztem. Oczekuj ściślejszej integracji z dekodowaniem spekulatywnym, głębszych horyzontów przewidywania i wykorzystania jako celu pomocniczego, który usprawni planowanie długoterminowe. W połączeniu z modelami rozumowania przewidywanie wielu kroków do przodu może pomóc modelom wewnętrznie symulować konsekwencje przed podjęciem decyzji.

Implementacja w świecie rzeczywistym

DeepSeek-V3 wykorzystuje cel MTP podczas wstępnego uczenia, aby zwiększyć wydajność danych i umożliwić dekodowanie spekulatywne

Modele generowania kodu Meta pokazujące wzrost dokładności w HumanEval i MBPP w wyniku przewidywania wielu tokenów

Dekodowanie autospekulacyjne: tworzenie 3-4 tokenów na każde przejście w przód, a następnie weryfikacja pod kątem szybszego, zachowującego dystrybucję wyniku

Szybsze autouzupełnianie w asystentach kodowania, w których proponowanych i sprawdzanych jest wiele wiarygodnych tokenów w jednym kroku

Zagrożenia i poręcze

Halucynacyjne fakty mogą po cichu trafiać do raportów, strumieni wsparcia lub wyników badań.

Szybka czułość może spowodować niespójne wyniki w przypadku podobnych żądań.

Wrażliwe dane tekstowe mogą zostać ujawnione, jeśli kontrola dostępu jest słaba.

Plan wdrożenia

1

Zdefiniuj format wyjściowy, ton i standardy jakości przed wdrożeniem.

2

Zawsze, gdy liczy się dokładność, korzystaj z zaufanych źródeł.

3

Utrzymuj punkt kontrolny weryfikacji ręcznej w przypadku wyników o wysokiej stawce.

4

Śledź wzorce niepowodzeń i regularnie powtarzaj monity lub przepływy pracy.

Odkrywaj dalej

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Multi-Token Prediction Training quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Rozpocznij quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Następny poradnik

Spekulacyjne przesyłanie strumieniowe i przewidywanie wielu tokenów

Często zadawane pytania

What is Multi-Token Prediction Training?

Zamiast przewidywać tylko następny token, model jest szkolony tak, aby przewidywał kilka przyszłych tokenów jednocześnie. To wyostrza sygnały uczenia się i odblokowuje szybsze wnioskowanie poprzez dekodowanie oparte na autospekulacji.

Co dodaje przewidywanie wielu tokenów w porównaniu ze standardowym szkoleniem dotyczącym następnego tokenu?

MTP dodaje dodatkowe głowice wyjściowe, więc model przewiduje następny token plus kilka tokenów dalej od jednego stanu ukrytego.

Który model w szczególności wykorzystywał cel przewidywania wielu tokenów podczas szkolenia wstępnego?

DeepSeek-V3 przyjął cel szkoleniowy MTP, aby poprawić wydajność danych i umożliwić dekodowanie spekulatywne.

Dlaczego MTP zagęszcza sygnał treningowy?

Przewidywanie kilku przyszłych tokenów oznacza, że ​​każda pozycja tokena powoduje kilka strat w przewidywaniu, co daje więcej sygnału uczenia się na token.

Jakie korzyści z wnioskowania umożliwiają dodatkowe głowice prognostyczne?

Głowice pomocnicze mogą w jednym przebiegu pobierać wiele tokenów, które są następnie weryfikowane, przyspieszając generowanie bez zmiany dystrybucji wyjściowej.

Co dzieje się z głowicami pomocniczymi po treningu, jeśli nie potrzebujesz przyśpieszeń?

Dodatkowe głowice są opcjonalne podczas wdrażania; odrzucenie ich utrzymuje model w tym samym rozmiarze co standardowy model następnego żetonu.