GHID AI limbaj

Modele de decodare speculative

Decodificarea speculativă folosește un model de „schiță” mic și rapid pentru a ghici câteva simboluri viitoare pe care un model mare le verifică apoi într-o singură trecere.

2 minute de lecturăUltima actualizare

Prezentare generală

It speeds up text generation 2-3x with no change to the output.

Scufundare în profunzime

Modelele mari de limbă generează text câte un token și fiecare pas necesită o trecere completă înainte prin miliarde de parametri - lenți și limitați de memorie. Decodificarea speculativă atacă acest lucru prin împerecherea modelului mare „țintă” cu un model „schiță” ieftin. Modelul schiță propune rapid o bucată de, să zicem, 4-8 jetoane candidate. Modelul mare le procesează apoi pe toate într-o singură trecere paralelă înainte și le verifică pe fiecare. Sunt acceptate jetoanele care se potrivesc cu ceea ce ar fi produs marele model; prima nepotrivire este corectată iar restul eliminat. Deoarece verificarea mai multor jetoane simultan costă aproximativ la fel ca și generarea unuia, rulările acceptate sunt aproape gratuite. În mod esențial, o etapă de eșantionare de respingere garantează că distribuția finală este identică cu rularea singur a modelului mare - viteză fără pierderi de calitate.

Perspectivă tehnică

Trucul cheie este un test de eșantionare de respingere modificat. Pentru fiecare token elaborat, probabilitatea modelului țintă este comparată cu cea a modelului draft. Dacă ținta atribuie o probabilitate egală sau mai mare, jetonul este acceptat; în caz contrar, este acceptat cu probabilitate egală cu raportul, iar la respingere se prelevează un jeton corectat dintr-o distribuție reziduală ajustată. Această matematică face ca rezultatul să fie echivalent cu eșantionarea directă din modelul mare.

Impact strategic

Viteză și scară

Fluxurile de lucru lingvistice se pot deplasa mai rapid fără a sacrifica consistența.

Acces și acoperire

Extinde accesul în diferite limbi și stiluri de comunicare.

Decizii mai clare

Echipele pot petrece mai mult timp jucând în timp ce automatizarea se ocupă de repetiție.

Viitorul modelelor de decodificare speculative

Așteptați-vă ca modelele nefinalizate să devină infrastructură standard în serverele de inferență precum vLLM și TensorRT-LLM. Variantele de auto-speculare (Medusa, EAGLE) renunță în întregime la modelul de schiță separat prin adăugarea de capete de predicție ușoare, iar redactarea bazată pe arbore verifică multe continuări candidate simultan. Pe măsură ce ferestrele de context cresc și domină costurile de servire, redactorii mai inteligenți, adaptați modelului și verificarea conștientă de hardware vor crește ratele de acceptare și debitul.

Implementare în lumea reală

Anthropic, OpenAI și Google folosesc decodarea speculativă pentru a reduce latența și costurile de difuzare pentru asistenții de chat care deservesc milioane de utilizatori.

vLLM și NVIDIA TensorRT-LLM oferă decodare speculativă încorporată, astfel încât auto-găzduitorii să poată accelera implementările Llama sau Mistral.

Asocierea unui model draft 7B cu o țintă 70B (de exemplu, familia Llama-3) pentru a dubla aproximativ jetoanele pe secundă pe un singur GPU.

Instrumentele de completare a codului folosesc un model de schiță minuscul pentru a propune un plan general pe care modelul mai mare le verifică, păstrând sugestiile rapide în editor.

Riscuri și balustrade

Faptele halucinate pot intra în liniște în rapoarte, fluxuri de sprijin sau rezultate ale cercetării.

Sensibilitatea promptă poate crea rezultate inconsecvente pentru solicitări similare.

Datele text sensibile pot fi expuse dacă controalele de acces sunt slabe.

Foaia de parcurs de implementare

1

Definiți formatul de ieșire, tonul și standardele de calitate înainte de lansare.

2

Răspunsurile la sol cu ​​surse de încredere ori de câte ori acuratețea contează.

3

Păstrați un punct de control uman pentru rezultate cu mize mari.

4

Urmăriți tiparele de eșec și reantrenați în mod regulat solicitările sau fluxurile de lucru.

Continuați să explorați

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Speculative Decoding Draft Models quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Quiz Start

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Următorul ghid

Editări speculative pentru modelele de cod

Întrebări frecvente

What is Speculative Decoding Draft Models?

Decodificarea speculativă folosește un model de „schiță” mic și rapid pentru a ghici câteva simboluri viitoare pe care un model mare le verifică apoi într-o singură trecere. Accelerează generarea de text de 2-3x fără nicio modificare a ieșirii.

Care este rolul principal al modelului „proiect” în decodificarea speculativă?

Modelul de proiect mic ghicește ieftin jetonele viitoare, pe care modelul țintă mare le verifică apoi într-o singură trecere paralelă.

De ce verificarea mai multor jetoane elaborate simultan economisește timp?

Generarea este legată de memorie; verificarea mai multor jetoane într-o singură trecere în loturi este aproape la fel de ieftină ca un singur pas, deci cursele acceptate sunt aproape gratuite.

Ce se întâmplă cu jetoanele elaborate după primul jeton pe care modelul țintă îl respinge?

Acceptarea continuă până la primul dezacord; acel jeton este corectat și toate jetoanele redactate ulterioare sunt aruncate.

Cum decodificarea speculativă asigură că calitatea ieșirii nu este degradată?

Un test de eșantionare de respingere modificat garantează că distribuția finală a simbolurilor se potrivește cu eșantionarea direct din modelul țintă.

Care dintre acestea este o abordare de „auto-speculare” care evită un model de proiect separat?

Medusa și EAGLE adaugă capete de predicție suplimentare ușoare modelului principal, astfel încât să își poată elabora propriile jetoane viitoare.