GUIDE IA du langage

Projets de modèles de décodage spéculatif

Le décodage spéculatif utilise un petit modèle « brouillon » rapide pour deviner plusieurs jetons à venir qu'un grand modèle vérifie ensuite en un seul passage.

2 minutes de lectureDernière mise à jour

Aperçu

It speeds up text generation 2-3x with no change to the output.

Plongée profonde

Les grands modèles de langage génèrent du texte un jeton à la fois, et chaque étape nécessite un passage complet à travers des milliards de paramètres – lent et limité en mémoire. Le décodage spéculatif s'attaque à ce problème en associant le grand modèle « cible » à un modèle « brouillon » bon marché. Le projet de modèle propose rapidement un groupe de, disons, 4 à 8 jetons candidats. Le grand modèle les traite ensuite tous en une seule passe avant parallèle et vérifie chacun d’entre eux. Les jetons qui correspondent à ce que le grand modèle aurait produit sont acceptés ; le premier décalage est corrigé et le reste est rejeté. Étant donné que la vérification de plusieurs jetons à la fois coûte à peu près le même prix que la génération d’un seul, les exécutions acceptées sont presque gratuites. Fondamentalement, une étape d’échantillonnage par rejet garantit que la distribution finale est identique à l’exécution du grand modèle seul : rapidité sans perte de qualité.

Aperçu technique

L’astuce clé est un test d’échantillonnage par rejet modifié. Pour chaque jeton rédigé, la probabilité du modèle cible est comparée à celle du modèle brouillon. Si la cible attribue une probabilité égale ou supérieure, le jeton est accepté ; sinon, il est accepté avec une probabilité égale au rapport, et en cas de rejet, un jeton corrigé est échantillonné à partir d'une distribution résiduelle ajustée. Ce calcul rend la sortie équivalente à un échantillonnage directement à partir du grand modèle.

Impact stratégique

Vitesse et échelle

Les flux de travail linguistiques peuvent évoluer plus rapidement sans sacrifier la cohérence.

Accès et portée

Il étend l’accès à toutes les langues et styles de communication.

Décisions plus claires

Les équipes peuvent consacrer plus de temps au jugement tandis que l’automatisation gère les répétitions.

L’avenir des projets de modèles de décodage spéculatif

Attendez-vous à ce que les projets de modèles deviennent une infrastructure standard dans les serveurs d'inférence tels que vLLM et TensorRT-LLM. Les variantes d'auto-spéculation (Medusa, EAGLE) abandonnent entièrement le modèle de projet séparé en ajoutant des têtes de prédiction légères, et la rédaction basée sur un arbre vérifie de nombreuses continuations candidates à la fois. À mesure que les fenêtres contextuelles augmentent et que les coûts de service dominent, des rédacteurs plus intelligents et adaptés aux modèles et une vérification tenant compte du matériel augmenteront les taux d'acceptation et le débit.

Mise en œuvre dans le monde réel

Anthropic, OpenAI et Google utilisent le décodage spéculatif pour réduire la latence et les coûts de service des assistants de chat au service de millions d'utilisateurs.

vLLM et NVIDIA TensorRT-LLM intègrent un décodage spéculatif afin que les auto-hébergeurs puissent accélérer les déploiements de Llama ou Mistral.

Associer un projet de modèle 7B à une cible 70B (par exemple, la famille Llama-3) pour doubler environ le nombre de jetons par seconde sur un seul GPU.

Les outils de complétion de code utilisent un petit brouillon de modèle pour proposer un modèle standard que le modèle plus grand vérifie, gardant ainsi les suggestions rapides dans l'éditeur.

Risques et garde-fous

Les faits hallucinés peuvent discrètement entrer dans des rapports, des flux de support ou des résultats de recherche.

La sensibilité des invites peut créer des résultats incohérents pour des demandes similaires.

Les données textuelles sensibles peuvent être exposées si les contrôles d’accès sont faibles.

Feuille de route de mise en œuvre

1

Définissez le format de sortie, le ton et les normes de qualité avant le déploiement.

2

Établissez des réponses auprès de sources fiables chaque fois que la précision est importante.

3

Gardez un point de contrôle d’examen humain pour les résultats à enjeux élevés.

4

Suivez les modèles de défaillance et recyclez régulièrement les invites ou les flux de travail.

Continuez à explorer

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Speculative Decoding Draft Models quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Démarrer le quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Guide suivant

Modifications spéculatives pour les modèles de code

Questions fréquemment posées

What is Speculative Decoding Draft Models?

Le décodage spéculatif utilise un petit modèle « brouillon » rapide pour deviner plusieurs jetons à venir qu'un grand modèle vérifie ensuite en un seul passage. Il accélère la génération de texte 2 à 3 fois sans modification de la sortie.

Quel est le rôle principal du modèle « ébauche » dans le décodage spéculatif ?

Le petit modèle de projet devine à moindre coût les jetons à venir, que le grand modèle cible vérifie ensuite en un seul passage parallèle.

Pourquoi la vérification simultanée de plusieurs jetons rédigés permet-elle de gagner du temps ?

La génération est liée à la mémoire ; La vérification de plusieurs jetons en une seule passe par lots est presque aussi bon marché qu'une seule étape, les exécutions acceptées sont donc presque gratuites.

Qu'arrive-t-il aux jetons rédigés après le premier jeton rejeté par le modèle cible ?

L'acceptation se poursuit jusqu'au premier désaccord ; ce jeton est corrigé et tous les jetons rédigés ultérieurement sont jetés.

Comment le décodage spéculatif garantit-il que la qualité de sortie ne soit pas dégradée ?

Un test d'échantillonnage par rejet modifié garantit que la distribution finale des jetons correspond à l'échantillonnage directement à partir du modèle cible.

Laquelle de ces approches constitue une approche « d’auto-spéculation » qui évite un projet de modèle distinct ?

Medusa et EAGLE ajoutent des têtes de prédiction supplémentaires légères au modèle principal afin qu'il puisse rédiger ses propres futurs jetons.