Szkolenie w zakresie przewidywania wielu tokenów
Zamiast przewidywać tylko następny token, model jest szkolony tak, aby przewidywał kilka przyszłych tokenów jednocześnie.
Przegląd
This sharpens learning signals and unlocks faster inference through self-speculative decoding.
Głębokie nurkowanie
Standardowe modele języka są trenowane z przewidywaniem następnego tokenu: biorąc pod uwagę kontekst, przewiduj pojedynczy następny token. Przewidywanie wielu tokenów (MTP), spopularyzowane w artykule Meta z 2024 r. i przyjęte w DeepSeek-V3, dodaje dodatkowe lekkie głowice wyjściowe, dzięki czemu model jednocześnie przewiduje następny token oraz drugi, trzeci i czwarty token przed nim z tego samego ukrytego stanu. Zmusza to sieć do planowania dalej w przyszłość i zagęszcza sygnał szkoleniowy — każda pozycja powoduje teraz wiele warunków straty. Meta odnotował szczególnie duże korzyści w zakresie kodowania i rozumowania generatywnego, przy czym większe modele odniosły większe korzyści. Co najważniejsze, dodatkowe głowy można wyrzucić po szkoleniu, więc rozmiar modelu podczas wdrażania nie musi się zwiększać.
Wgląd techniczny
MTP przyłącza n niezależnych głowic predykcyjnych na szczycie wspólnej szyny transformatorowej; głowa k przewiduje token na pozycji t+k z reprezentacji na pozycji t. Straty sumowane są w trakcie treningu. Podsumowując, głowice pomocnicze umożliwiają dekodowanie samospekulacyjne: model proponuje kilka tokenów w jednym przebiegu, a następnie je weryfikuje, osiągając nawet około 3x szybszą generację bez zmiany dystrybucji wyjściowej.
Wpływ strategiczny
Szybkość i skala
Przepływy pracy związane z językiem mogą przebiegać szybciej bez utraty spójności.
Dostęp i zasięg
Rozszerza dostęp w różnych językach i stylach komunikacji.
Jaśniejsze decyzje
Zespoły mogą spędzać więcej czasu na ocenie, podczas gdy automatyzacja radzi sobie z powtarzalnością.
Przyszłość szkolenia w zakresie przewidywania wielu tokenów
MTP staje się domyślnym składnikiem pionierskich receptur szkoleniowych, ponieważ poprawia zarówno jakość, jak i szybkość wnioskowania niewielkim kosztem. Oczekuj ściślejszej integracji z dekodowaniem spekulatywnym, głębszych horyzontów przewidywania i wykorzystania jako celu pomocniczego, który usprawni planowanie długoterminowe. W połączeniu z modelami rozumowania przewidywanie wielu kroków do przodu może pomóc modelom wewnętrznie symulować konsekwencje przed podjęciem decyzji.
Implementacja w świecie rzeczywistym
DeepSeek-V3 wykorzystuje cel MTP podczas wstępnego uczenia, aby zwiększyć wydajność danych i umożliwić dekodowanie spekulatywne
Modele generowania kodu Meta pokazujące wzrost dokładności w HumanEval i MBPP w wyniku przewidywania wielu tokenów
Dekodowanie autospekulacyjne: tworzenie 3-4 tokenów na każde przejście w przód, a następnie weryfikacja pod kątem szybszego, zachowującego dystrybucję wyniku
Szybsze autouzupełnianie w asystentach kodowania, w których proponowanych i sprawdzanych jest wiele wiarygodnych tokenów w jednym kroku
Zagrożenia i poręcze
Halucynacyjne fakty mogą po cichu trafiać do raportów, strumieni wsparcia lub wyników badań.
Szybka czułość może spowodować niespójne wyniki w przypadku podobnych żądań.
Wrażliwe dane tekstowe mogą zostać ujawnione, jeśli kontrola dostępu jest słaba.
Plan wdrożenia
Zdefiniuj format wyjściowy, ton i standardy jakości przed wdrożeniem.
Zawsze, gdy liczy się dokładność, korzystaj z zaufanych źródeł.
Utrzymuj punkt kontrolny weryfikacji ręcznej w przypadku wyników o wysokiej stawce.
Śledź wzorce niepowodzeń i regularnie powtarzaj monity lub przepływy pracy.
Odkrywaj dalej
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Multi-Token Prediction Training quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Następny poradnik
Spekulacyjne przesyłanie strumieniowe i przewidywanie wielu tokenów
Często zadawane pytania
What is Multi-Token Prediction Training?
Zamiast przewidywać tylko następny token, model jest szkolony tak, aby przewidywał kilka przyszłych tokenów jednocześnie. To wyostrza sygnały uczenia się i odblokowuje szybsze wnioskowanie poprzez dekodowanie oparte na autospekulacji.
Co dodaje przewidywanie wielu tokenów w porównaniu ze standardowym szkoleniem dotyczącym następnego tokenu?
MTP dodaje dodatkowe głowice wyjściowe, więc model przewiduje następny token plus kilka tokenów dalej od jednego stanu ukrytego.
Który model w szczególności wykorzystywał cel przewidywania wielu tokenów podczas szkolenia wstępnego?
DeepSeek-V3 przyjął cel szkoleniowy MTP, aby poprawić wydajność danych i umożliwić dekodowanie spekulatywne.
Dlaczego MTP zagęszcza sygnał treningowy?
Przewidywanie kilku przyszłych tokenów oznacza, że każda pozycja tokena powoduje kilka strat w przewidywaniu, co daje więcej sygnału uczenia się na token.
Jakie korzyści z wnioskowania umożliwiają dodatkowe głowice prognostyczne?
Głowice pomocnicze mogą w jednym przebiegu pobierać wiele tokenów, które są następnie weryfikowane, przyspieszając generowanie bez zmiany dystrybucji wyjściowej.
Co dzieje się z głowicami pomocniczymi po treningu, jeśli nie potrzebujesz przyśpieszeń?
Dodatkowe głowice są opcjonalne podczas wdrażania; odrzucenie ich utrzymuje model w tym samym rozmiarze co standardowy model następnego żetonu.