GUIDE IA du langage

Perplexity et métriques linguistiques

Perplexity est le score classique indiquant à quel point un modèle de langage est « surpris » par un texte réel : un niveau inférieur signifie qu'il prédit les mots avec plus de confiance.

2 minutes de lectureDernière mise à jour

Aperçu

It and metrics like BLEU and ROUGE are how researchers actually measure whether a model is getting better.

Plongée profonde

Un modèle linguistique attribue une probabilité à chaque mot suivant. Perplexity transforme ces probabilités en un nombre unique qui demande : en moyenne, entre combien de choix équiprobables le modèle était-il déchiré à chaque étape ? Si un modèle est parfaitement sûr et correct, la perplexité est de 1 ; s'il s'agit de deviner uniformément parmi 50 000 mots, la perplexité est de 50 000. Plus bas, c'est mieux. Il s'agit de l'exponentielle mathématique de la perte moyenne par mot, elle suit donc directement la formation. Mais la perplexité mesure uniquement la prédiction du mot suivant, et non si le résultat est utile, vrai ou bien écrit. C'est pourquoi les tâches de génération ajoutent des métriques telles que BLEU (chevauchement de n-grammes pour la traduction) et ROUGE (chevauchement pour le résumé), et pourquoi les évaluations modernes s'appuient de plus en plus sur des évaluations humaines et des références de tâches.

Aperçu technique

Perplexity est égal à l'exponentielle de la log-vraisemblance négative moyenne que le modèle attribue à un texte retenu : exp(-(1/N) * somme du log P(mot | mots précédents)). Il s'agit littéralement d'une version transformée de la perte d'entropie croisée, simplement exprimée comme un facteur de branchement effectif au lieu de bits ou de nats. Parce que cela dépend du vocabulaire exact et du tokenizer du modèle, les valeurs de perplexité ne sont comparables qu'entre les modèles qui partagent la même tokenisation : comparer directement un modèle au niveau du mot à un modèle de sous-mot n'a aucun sens.

Impact stratégique

Vitesse et échelle

Les flux de travail linguistiques peuvent évoluer plus rapidement sans sacrifier la cohérence.

Accès et portée

Il étend l’accès à toutes les langues et styles de communication.

Décisions plus claires

Les équipes peuvent consacrer plus de temps au jugement tandis que l’automatisation gère les répétitions.

L'avenir de Perplexity et des métriques linguistiques

Perplexity restera un diagnostic de base du temps de formation car il est bon marché et suit l'optimisation en douceur, mais le domaine l'a largement dépassé pour juger des capacités réelles. À mesure que les modèles saturent, l'évaluation se déplace vers des références de tâches telles que MMLU, les classements de préférences humaines et la notation LLM en tant que juge de l'utilité et de l'exactitude. Attendez-vous à ce que la perplexité reste l'indicateur de mesure du tableau de bord que les ingénieurs surveillent pendant la pré-formation, tandis que les affirmations publiques selon lesquelles un modèle est « meilleur » s'appuient sur des suites de référence et des évaluations humaines face à face qui capturent le raisonnement et la véracité de la perplexité.

Mise en œuvre dans le monde réel

Suivre la perplexité de la validation pendant le pré-entraînement pour confirmer qu'un modèle est toujours en train d'apprendre et pour détecter quand il commence à surajuster

Utilisation du score BLEU pour comparer un nouveau système de traduction automatique à une traduction de référence humaine

Reporting du chevauchement de ROUGE-L pour comparer un modèle de résumé d'actualités aux résumés de référence

Comparaison de deux points de contrôle de modèles sur le même corpus retenu pour décider lequel prédit le texte avec le plus de confiance

Risques et garde-fous

Les faits hallucinés peuvent discrètement entrer dans des rapports, des flux de support ou des résultats de recherche.

La sensibilité des invites peut créer des résultats incohérents pour des demandes similaires.

Les données textuelles sensibles peuvent être exposées si les contrôles d’accès sont faibles.

Feuille de route de mise en œuvre

1

Définissez le format de sortie, le ton et les normes de qualité avant le déploiement.

2

Établissez des réponses auprès de sources fiables chaque fois que la précision est importante.

3

Gardez un point de contrôle d’examen humain pour les résultats à enjeux élevés.

4

Suivez les modèles de défaillance et recyclez régulièrement les invites ou les flux de travail.

Continuez à explorer

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Perplexity and Language Metrics quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Démarrer le quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Guide suivant

Modélisation du langage

Questions fréquemment posées

What is Perplexity and Language Metrics?

Perplexity est le score classique indiquant à quel point un modèle de langage est « surpris » par un texte réel : un niveau inférieur signifie qu'il prédit les mots avec plus de confiance. C'est grâce à lui et à des mesures comme BLEU et ROUGE que les chercheurs mesurent réellement si un modèle s'améliore.

Qu'indique un score de perplexité INFÉRIEUR à propos d'un modèle de langage ?

Perplexity mesure le degré de surprise d'un modèle par un texte réel ; une perplexité plus faible signifie qu'il attribue une probabilité plus élevée aux mots suivants, ce qui permet de prédire avec plus de confiance.

Perplexity est mathématiquement dérivé de quelle quantité d'entraînement ?

Perplexity est l'exponentielle de la log-vraisemblance négative moyenne, ce qui en fait une transformation directe de la perte d'entropie croisée pour laquelle le modèle est entraîné à minimiser.

Un modèle attribue une probabilité uniforme sur un vocabulaire de 10 000 mots sans apprentissage. Quelle est sa perplexité ?

Perplexity est le nombre effectif de choix équiprobables. Une simple estimation uniforme de plus de 10 000 mots donne une perplexité de 10 000.

Pourquoi les scores de perplexité de deux modèles différents peuvent-ils être trompeurs à comparer directement ?

Étant donné que la perplexité est calculée par jeton, un modèle au niveau du mot et un modèle sous-mot divisent le texte différemment, ce qui rend leurs valeurs brutes de perplexité non directement comparables.

Quelle métrique est la plus associée à l’évaluation de la traduction automatique par chevauchement de n-grammes avec une référence ?

BLEU mesure le chevauchement des n-grammes de mots entre la traduction d'un système et une référence humaine et constitue la norme de longue date pour l'évaluation de la traduction.