Décodage spéculatif
Le décodage spéculatif permet aux grands modèles de langage de générer du texte plus rapidement en utilisant un petit modèle de « brouillon » rapide pour deviner plusieurs jetons à l'avance, puis en demandant au grand modèle de les vérifier tous en même temps.
Aperçu
It speeds up inference 2-3x with identical output quality.
Plongée profonde
Normalement, un LLM génère du texte un jeton à la fois : chaque jeton nécessite un passage complet à travers le modèle géant, et vous ne pouvez pas commencer le suivant tant que celui en cours n'est pas terminé. C'est lent car il est limité à la mémoire et non au calcul : le GPU passe la plupart de son temps à charger des poids, sans faire de calculs. Le décodage spéculatif brise le goulot d’étranglement. Un petit modèle de brouillon bon marché propose un morceau de, disons, cinq jetons candidats. Le grand modèle « cible » traite ensuite les cinq en une seule passe avant parallèle et les vérifie. Les jetons correspondant à ce qu’il aurait produit sont acceptés ; au premier désaccord, il corrige et écarte le reste. Étant donné que la vérification de nombreux jetons coûte à peu près le même prix que la génération d’un seul, les suppositions acceptées sont presque gratuites.
Aperçu technique
La partie intelligente est une règle d'échantillonnage par rejet qui garantit que la distribution de sortie est mathématiquement identique à l'exécution du modèle cible seul : la qualité n'est donc pas approximative, elle est exacte. Le taux d'acceptation détermine l'accélération : plus le petit modèle prédit le grand, plus il y a de jetons à chaque étape de vérification. Des variantes telles que Medusa ajoutent des têtes de prédiction supplémentaires au modèle cible lui-même et des brouillons EAGLE dans l'espace des fonctionnalités, éliminant ainsi le besoin d'un modèle de brouillon distinct.
Impact stratégique
Coût et budget
Les décisions en matière d'architecture déterminent les performances et les coûts d'exploitation pendant des années.
Décisions plus claires
La formation technique aide les équipes à choisir la bonne pile, pas seulement la plus récente.
Contrôle qualité
De meilleurs choix d’ingénierie réduisent les incidents de fiabilité en production.
L'avenir du décodage spéculatif
Le décodage spéculatif devient la valeur par défaut dans les piles de service telles que vLLM et TensorRT-LLM. Attendez-vous à ce que les méthodes d'auto-rédaction (Medusa, EAGLE, Lookahead) dominent car elles évitent de maintenir un deuxième modèle, ainsi qu'à la spéculation basée sur les arbres qui vérifie plusieurs branches candidates par étape. À mesure que les modèles se développent, le goulot d'étranglement lié à la mémoire s'aggrave, ce qui rend la spéculation encore plus précieuse, et les rédacteurs conscients du matériel augmenteront les accélérations réelles.
Mise en œuvre dans le monde réel
Un projet de modèle 7B proposant des jetons pour un modèle de chat 70B afin de réduire la latence de réponse dans un assistant de production
Les têtes de Medusa sont boulonnées sur un LLM afin de prédire plusieurs futurs jetons à la fois sans projet de modèle séparé.
vLLM permettant le décodage spéculatif pour augmenter le débit de jetons par seconde sur un cluster de desserte
Rédaction EAGLE dans l'espace des fonctionnalités cachées du modèle pour augmenter le taux d'acceptation et la vitesse globale
Risques et garde-fous
L’optimisation d’un benchmark peut masquer des faiblesses plus larges du système.
Les coûts d’infrastructure et de maintenance sont souvent sous-estimés.
Les lacunes en matière de sécurité et d’observabilité peuvent se creuser à mesure que les systèmes deviennent plus complexes.
Feuille de route de mise en œuvre
Définissez les objectifs de latence, de qualité et de coût avant la mise en œuvre.
Benchmark dans des conditions de charge et de données réalistes.
Surveillance des instruments pour détecter les erreurs, la dérive et l'impact sur l'utilisateur.
Préparez les chemins de restauration et de réponse aux incidents avant la mise à l’échelle.
Continuez à explorer
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Speculative Decoding quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Guide suivant
Décodage spéculatif avec EAGLE
Questions fréquemment posées
What is Speculative Decoding?
Le décodage spéculatif permet aux grands modèles de langage de générer du texte plus rapidement en utilisant un petit modèle de « brouillon » rapide pour deviner plusieurs jetons à l'avance, puis en demandant au grand modèle de les vérifier tous en même temps. Il accélère l'inférence 2 à 3 fois avec une qualité de sortie identique.
Quelle est l’idée centrale du décodage spéculatif ?
Un modèle de brouillon rapide propose plusieurs jetons, et le grand modèle cible les vérifie tous en un seul passage parallèle.
Pourquoi la génération normale de LLM, un jeton à la fois, est-elle lente ?
Chaque étape charge principalement les énormes matrices de poids depuis la mémoire plutôt que d'effectuer des calculs lourds, de sorte que le GPU est sous-utilisé.
Que se passe-t-il au premier jeton où les modèles de projet et cibles sont en désaccord ?
Les jetons à hauteur du désaccord sont acceptés ; à partir de la disparité, ils sont rejetés et le jeton correct du modèle cible est conservé.
Comment le décodage spéculatif affecte-t-il la qualité de la sortie ?
Une règle d'échantillonnage par rejet garantit que la distribution finale correspond exactement au modèle cible, de sorte que la qualité reste inchangée.
Qu’est-ce qui détermine le plus directement l’accélération du décodage spéculatif ?
Plus le modèle cible accepte de jetons rédigés par étape de vérification, plus l'accélération est grande.