Modélisation du langage
La modélisation du langage est la tâche d'une simplicité trompeuse qui consiste à prédire quel mot ou quel jeton viendra ensuite, compte tenu du texte jusqu'à présent.
Aperçu
This single objective, scaled up massively, is what produces today's powerful chatbots and writing assistants.
Plongée profonde
À la base, un modèle de langage attribue des probabilités aux séquences de texte. Compte tenu de l'invite « La capitale de la France est », il estime la probabilité de chaque prochain jeton possible, et « Paris » devrait obtenir un score élevé. Les premiers modèles de langage étaient des n-grammes statistiques qui comptaient simplement la fréquence d'apparition des séquences de mots, mais ils avaient du mal avec un contexte long et des phrases invisibles. Les modèles de langage neuronal ont remplacé le comptage par des représentations apprises, et l'architecture du transformateur de 2017 permet aux modèles de traiter efficacement de longues portions de texte. Les grands modèles de langage modernes comme la famille GPT sont formés sur d'énormes corpus de textes avec un seul objectif : prédire le prochain jeton. Remarquablement, bien faire cela oblige le modèle à absorber la grammaire, les faits, les modèles de raisonnement et le style, car prédire un texte avec précision nécessite de le comprendre. La génération fonctionne en prédisant à plusieurs reprises le prochain jeton et en le réinjectant.
Aperçu technique
La plupart des modèles de langage modernes sont autorégressifs : ils prennent en compte la probabilité d'une phrase dans un produit des probabilités du prochain jeton, prédisant un jeton à la fois, de gauche à droite. La formation minimise la perte d'entropie croisée, ce qui récompense l'attribution d'une probabilité élevée au jeton suivant dans le texte de formation. Ceci est auto-supervisé, les étiquettes sont libérées du texte lui-même, donc aucune annotation humaine n'est nécessaire. Au moment de la génération, les stratégies d'échantillonnage telles que la température, le top-k et le top-p (noyau) contrôlent le compromis entre la sortie prévisible et créative.
Impact stratégique
Vitesse et échelle
Les flux de travail linguistiques peuvent évoluer plus rapidement sans sacrifier la cohérence.
Accès et portée
Il étend l’accès à toutes les langues et styles de communication.
Décisions plus claires
Les équipes peuvent consacrer plus de temps au jugement tandis que l’automatisation gère les répétitions.
L'avenir de la modélisation linguistique
La prédiction du prochain jeton s'est révélée étonnamment puissante, et les lois de mise à l'échelle montrent que des modèles plus volumineux et davantage de données continuent d'améliorer les capacités, même si les gains ralentissent et que les données de haute qualité se raréfient. La frontière se déplace vers le raisonnement, des fenêtres contextuelles plus longues et des méthodes post-formation telles que l'apprentissage par renforcement à partir de la rétroaction humaine qui façonnent le comportement une fois le modèle de base construit. Attendez-vous à un mélange continu de la modélisation du langage avec des outils, de la récupération et des entrées multimodales, tandis que l'objectif fondamental de prédire le prochain jeton reste la base sur laquelle tout le reste est construit.
Mise en œuvre dans le monde réel
Remplissage automatique sur le clavier de votre téléphone ou dans un e-mail suggérant le mot suivant au fur et à mesure que vous tapez
Un chatbot comme ChatGPT générant une réponse fluide en prédisant à plusieurs reprises le prochain jeton
Des éditeurs de code tels que GitHub Copilot prédisent la prochaine ligne de code à partir du contexte environnant
Systèmes de reconnaissance vocale utilisant un modèle de langage pour choisir la transcription la plus plausible parmi des options à consonance similaire
Risques et garde-fous
Les faits hallucinés peuvent discrètement entrer dans des rapports, des flux de support ou des résultats de recherche.
La sensibilité des invites peut créer des résultats incohérents pour des demandes similaires.
Les données textuelles sensibles peuvent être exposées si les contrôles d’accès sont faibles.
Feuille de route de mise en œuvre
Définissez le format de sortie, le ton et les normes de qualité avant le déploiement.
Établissez des réponses auprès de sources fiables chaque fois que la précision est importante.
Gardez un point de contrôle d’examen humain pour les résultats à enjeux élevés.
Suivez les modèles de défaillance et recyclez régulièrement les invites ou les flux de travail.
Continuez à explorer
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Language Modeling quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Guide suivant
Modélisation du langage masqué
Questions fréquemment posées
What is Language Modeling?
La modélisation du langage est la tâche d'une simplicité trompeuse qui consiste à prédire quel mot ou quel jeton viendra ensuite, compte tenu du texte jusqu'à présent. C’est cet objectif unique, massivement développé, qui produit les puissants chatbots et assistants d’écriture d’aujourd’hui.
Quelle est la tâche principale effectuée par un modèle de langage ?
Un modèle de langage estime la probabilité de ce qui vient ensuite dans une séquence, et la génération fonctionne en prédisant et en ajoutant à plusieurs reprises le jeton suivant.
Quelle était l’une des principales limites des premiers modèles de langage n-gram ?
Les modèles N-gram reposaient sur le comptage de séquences de mots courtes, ils géraient donc mal le contexte à longue portée et échouaient sur des phrases qu'ils n'avaient jamais vues.
Pourquoi la formation sur les modèles linguistiques est-elle appelée « auto-supervisée » ?
Le jeton suivant correct est déjà présent dans le texte, le modèle crée donc ses propres cibles sans annotation manuelle.
Que signifie « autorégressif » pour un modèle de langage ?
Les modèles autorégressifs génèrent du texte jeton par jeton, conditionnant chaque nouvelle prédiction sur tout ce qui a été généré jusqu'à présent.
Quelle fonction de perte est généralement utilisée pour entraîner un modèle de langage ?
La formation minimise l'entropie croisée, récompensant le modèle pour avoir attribué une probabilité élevée au prochain jeton réel observé dans le texte de formation.