PRZEWODNIK Językowy AI

Szkicowe modele dekodowania spekulatywnego

Dekodowanie spekulatywne wykorzystuje mały, szybki model „szkicowy” do odgadnięcia kilku nadchodzących tokenów, które następnie weryfikuje duży model w jednym przebiegu.

2 minuty czytaniaOstatnia aktualizacja

Przegląd

Przyspiesza generowanie tekstu 2-3 razy bez zmiany wyjścia.

Głębokie nurkowanie

Duże modele językowe generują tekst po jednym toenie na raz, a każdy krok wymaga pełnego przejścia w przód przez miliardy parametrów — jest to powolne i wiąże się z dużą ilością pamięci. Dekodowanie spekulatywne atakuje to, łącząc duży model „docelowy” z tanim modelem „roboczym”. Wersja robocza modelu szybko proponuje porcję, powiedzmy, 4-8 tokenów kandydujących. Następnie duży model przetwarza je wszystkie w jednym równoległym przejściu do przodu i sprawdza każdy z nich. Akceptowane są żetony odpowiadające temu, co wyprodukowałby duży model; pierwsza niezgodność jest korygowana, a reszta odrzucana. Ponieważ weryfikacja kilku tokenów jednocześnie kosztuje mniej więcej tyle samo, co wygenerowanie jednego, akceptowane przebiegi są prawie bezpłatne. Co najważniejsze, etap próbkowania odrzucającego gwarantuje, że ostateczna dystrybucja będzie identyczna z pracą samego dużego modelu – prędkość bez utraty jakości.

Wgląd techniczny

Kluczową sztuczką jest zmodyfikowany test próbkowania odrzucającego. Dla każdego wyselekcjonowanego tokena prawdopodobieństwo modelu docelowego jest porównywane z prawdopodobieństwem modelu roboczego. Jeżeli cel przydzieli równe lub większe prawdopodobieństwo, żeton zostaje zaakceptowany; w przeciwnym razie jest akceptowany z prawdopodobieństwem równym współczynnikowi, a po odrzuceniu pobierany jest poprawiony token z skorygowanego rozkładu rezydualnego. Ta matematyka sprawia, że ​​wynik w sposób udowodniony jest równoważny próbkowaniu bezpośrednio z dużego modelu.

Wpływ strategiczny

Szybkość i skala

Przepływy pracy związane z językiem mogą przebiegać szybciej bez utraty spójności.

Dostęp i zasięg

Rozszerza dostęp w różnych językach i stylach komunikacji.

Jaśniejsze decyzje

Zespoły mogą spędzać więcej czasu na ocenie, podczas gdy automatyzacja radzi sobie z powtarzalnością.

Przyszłość projektów modeli dekodowania spekulatywnego

Można się spodziewać, że modele robocze staną się standardową infrastrukturą w serwerach wnioskowania, takich jak vLLM i TensorRT-LLM. Warianty oparte na samospekulacji (Medusa, EAGLE) całkowicie rezygnują z oddzielnego modelu roboczego, dodając lekkie głowice prognostyczne, a kreślenie oparte na drzewach weryfikuje jednocześnie wiele kontynuacji kandydatów. W miarę powiększania się okien kontekstowych i dominacji kosztów obsługi, mądrzejsi, dopasowujący się do modelu kreatorzy i weryfikacja uwzględniająca sprzęt zwiększą współczynniki akceptacji i przepustowość.

Implementacja w świecie rzeczywistym

Anthropic, OpenAI i Google używają dekodowania spekulatywnego, aby zmniejszyć opóźnienia i koszty obsługi w asystentach czatu obsługujących miliony użytkowników.

vLLM i NVIDIA TensorRT-LLM mają wbudowane dekodowanie spekulatywne, dzięki czemu osoby samodzielnie hostujące mogą przyspieszyć wdrożenia Lamy lub Mistrala.

Połączenie wersji roboczej modelu 7B z docelowym procesorem 70B (np. rodziną Lamy-3) w celu uzyskania mniej więcej dwukrotnej liczby tokenów na sekundę na pojedynczym procesorze graficznym.

Narzędzia do uzupełniania kodu korzystają z małego modelu roboczego, aby zaproponować szablon, który weryfikuje większy model, dzięki czemu sugestie będą szybko widoczne w edytorze.

Zagrożenia i poręcze

Halucynacyjne fakty mogą po cichu trafiać do raportów, strumieni wsparcia lub wyników badań.

Szybka czułość może spowodować niespójne wyniki w przypadku podobnych żądań.

Wrażliwe dane tekstowe mogą zostać ujawnione, jeśli kontrola dostępu jest słaba.

Plan wdrożenia

1

Zdefiniuj format wyjściowy, ton i standardy jakości przed wdrożeniem.

2

Zawsze, gdy liczy się dokładność, korzystaj z zaufanych źródeł.

3

Utrzymuj punkt kontrolny weryfikacji ręcznej w przypadku wyników o wysokiej stawce.

4

Śledź wzorce niepowodzeń i regularnie powtarzaj monity lub przepływy pracy.

Odkrywaj dalej

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Speculative Decoding Draft Models quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Rozpocznij quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Następny poradnik

Spekulatywne edycje modeli kodu

Często zadawane pytania

Czym jest spekulatywne dekodowanie modeli roboczych?

Dekodowanie spekulatywne wykorzystuje mały, szybki model „szkicowy” do odgadnięcia kilku nadchodzących tokenów, które następnie weryfikuje duży model w jednym przebiegu. Przyspiesza generowanie tekstu 2-3 razy bez zmiany wyników.

Jaka jest główna rola modelu „szkicowego” w dekodowaniu spekulatywnym?

Mały model roboczy tanio odgaduje nadchodzące tokeny, które następnie duży model docelowy sprawdza w jednym równoległym przebiegu.

Dlaczego jednoczesna weryfikacja wielu wystawionych tokenów oszczędza czas?

Generacja jest związana z pamięcią; sprawdzanie kilku tokenów w jednym karnecie zbiorczym jest prawie tak tanie jak jeden krok, więc akceptowane przebiegi są prawie bezpłatne.

Co dzieje się z opracowanymi tokenami po odrzuceniu pierwszego tokena przez model docelowy?

Akceptacja trwa aż do pierwszej niezgody; żeton ten jest poprawiany, a wszystkie kolejne wystawione żetony są odrzucane.

W jaki sposób dekodowanie spekulatywne zapewnia, że jakość wyjściowa nie ulegnie pogorszeniu?

Zmodyfikowany test próbkowania odrzucającego gwarantuje, że ostateczna dystrybucja tokenów odpowiada próbkowaniu bezpośrednio z modelu docelowego.

Które z nich jest podejściem opartym na samospekulacji, w którym unika się osobnego projektu modelu?

Medusa i EAGLE dodają do głównego modelu lekkie, dodatkowe głowice prognostyczne, dzięki czemu może on tworzyć własne przyszłe tokeny.