GUIDE IA du langage

Prédiction du prochain jeton

La prédiction du jeton suivant est l’objectif d’une simplicité trompeuse derrière les modèles de style GPT : étant donné tout ce qui s’est passé jusqu’à présent, devinez le prochain morceau de texte.

2 minutes de lectureDernière mise à jour

Aperçu

Repeated billions of times, this single task produces models that write, reason, and converse.

Plongée profonde

La prédiction du jeton suivant entraîne un modèle pour attribuer des probabilités au jeton suivant en fonction de tous les jetons précédents. Le texte est d'abord divisé en jetons (morceaux de sous-mots) par un tokeniseur comme le codage par paire d'octets. Un transformateur réservé au décodeur lit la séquence de gauche à droite et génère une distribution de probabilité sur l'ensemble du vocabulaire pour la position suivante. Pendant la formation, le modèle affiche des corpus de texte massifs et est pénalisé chaque fois qu'il attribue une faible probabilité au jeton suivant. Au moment de la génération, le modèle échantillonne ou sélectionne avidement un jeton, l'ajoute et répète cette boucle de manière autorégressive. Cet objectif évolue remarquablement : GPT-2, GPT-3 et ses successeurs ont tous appris la grammaire, les faits, la traduction et le raisonnement simplement en devenant très doués pour prédire le prochain jeton.

Aperçu technique

Le mécanisme clé est l’auto-attention causale (masquée) : lors de la prédiction de la position N, le modèle ne peut s’intéresser qu’aux positions 1 à N-1, jamais au futur. La couche de sortie projette l'état caché final sur le vocabulaire et applique softmax pour obtenir des probabilités. La formation minimise l'entropie croisée, ce qui équivaut à maximiser la probabilité du texte observé. Les contrôles d'échantillonnage tels que la température et le top-p remodèlent cette distribution lors de l'inférence pour trouver un compromis entre créativité et fiabilité.

Impact stratégique

Vitesse et échelle

Les flux de travail linguistiques peuvent évoluer plus rapidement sans sacrifier la cohérence.

Accès et portée

Il étend l’accès à toutes les langues et styles de communication.

Décisions plus claires

Les équipes peuvent consacrer plus de temps au jugement tandis que l’automatisation gère les répétitions.

L'avenir de la prédiction du prochain jeton

La prédiction du prochain jeton sous-tend essentiellement tous les grands modèles de langage modernes et restera l’épine dorsale de l’IA générative. La recherche l'étend avec des fenêtres contextuelles plus longues, un décodage spéculatif et parallèle pour plus de vitesse et des objectifs de prédiction multi-jetons qui devinent plusieurs futurs jetons à la fois. Apprentissage par renforcement à partir des couches de rétroaction humaine pour aligner les résultats. La frontière rend le même objectif simple moins cher, plus rapide et plus contrôlable à une échelle toujours plus grande.

Mise en œuvre dans le monde réel

Permettre à ChatGPT et à des assistants similaires de générer des réponses conversationnelles, un jeton à la fois.

Remplissage automatique et suggestions de code dans des outils comme GitHub Copilot au fur et à mesure que vous tapez.

Rédaction d'e-mails, d'articles et de textes marketing à partir d'une courte invite.

Génération de texte en temps réel dans des assistants d'écriture qui terminent vos phrases.

Risques et garde-fous

Les faits hallucinés peuvent discrètement entrer dans des rapports, des flux de support ou des résultats de recherche.

La sensibilité des invites peut créer des résultats incohérents pour des demandes similaires.

Les données textuelles sensibles peuvent être exposées si les contrôles d’accès sont faibles.

Feuille de route de mise en œuvre

1

Définissez le format de sortie, le ton et les normes de qualité avant le déploiement.

2

Établissez des réponses auprès de sources fiables chaque fois que la précision est importante.

3

Gardez un point de contrôle d’examen humain pour les résultats à enjeux élevés.

4

Suivez les modèles de défaillance et recyclez régulièrement les invites ou les flux de travail.

Continuez à explorer

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Next-Token Prediction quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Démarrer le quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Guide suivant

Formation à la prédiction multi-jetons

Questions fréquemment posées

What is Next-Token Prediction?

La prédiction du jeton suivant est l’objectif d’une simplicité trompeuse derrière les modèles de style GPT : étant donné tout ce qui s’est passé jusqu’à présent, devinez le prochain morceau de texte. Répétée des milliards de fois, cette tâche unique produit des modèles qui écrivent, raisonnent et conversent.

Que produit un modèle de prédiction du prochain jeton à chaque étape ?

Le modèle produit une probabilité pour chaque prochain jeton possible, puis l'un d'entre eux est sélectionné par échantillonnage ou par choix glouton.

Quel type d’attention un décodeur de style GPT utilise-t-il ?

Le masquage causal garantit que la position N ne peut voir que les positions qui la précèdent, préservant ainsi la configuration de prédiction de gauche à droite.

Que signifie ici la génération « autorégressive » ?

La génération autorégressive produit un jeton, l'ajoute au contexte et répète la boucle.

Quelle fonction de perte est généralement minimisée pendant l’entraînement ?

L'entropie croisée pénalise le modèle pour attribuer une faible probabilité au vrai prochain jeton, ce qui équivaut à maximiser la probabilité.

À quoi sert l’augmentation de la température pendant l’échantillonnage ?

Une température plus élevée aplatit la distribution de probabilité, augmentant le caractère aléatoire ; une température plus basse rend les choix plus conservateurs.