GUIDE IA du langage

Tokenisation de sous-mots

La tokenisation des sous-mots divise le texte en unités plus petites que les mots mais plus grandes que les caractères, comme « jeton » plus « isation ».

2 minutes de lectureDernière mise à jour

Aperçu

It is the standard way modern language models turn text into the discrete IDs they actually process, balancing vocabulary size against meaning.

Plongée profonde

Les mots sont trop nombreux pour être énumérés (les vocabulaires seraient énormes et manqueraient des mots rares), tandis que les caractères individuels ont peu de sens et créent des séquences très longues. La tokenisation des sous-mots est le compromis : elle conserve les mots fréquents entiers mais divise les mots rares ou complexes en fragments significatifs. Le « malheur » pourrait devenir « un », « bonheur », « être ». Les principaux algorithmes incluent Byte-Pair Encoding (utilisé par GPT), WordPièce (utilisé par BERT) et Unigram/SentencePièce (utilisé par T5 et de nombreux modèles multilingues). Cette approche gère les mots invisibles avec élégance, partage des morceaux entre des mots apparentés (« jouer », « jouer », « joué ») et prend en charge n'importe quelle langue. Chaque fragment correspond à un identifiant entier, et ces identifiants sont ce que la couche d'intégration du modèle convertit en vecteurs.

Aperçu technique

Différents algorithmes choisissent les sous-mots différemment : BPE fusionne les paires fréquentes de bas en haut, WordPièce sélectionne les fusions qui augmentent le plus la probabilité du corpus, et Unigram commence avec un vocabulaire étendu et élague les jetons qui nuisent le moins à la probabilité. WordPièce marque les éléments internes aux mots avec un préfixe « ## », tandis que SentencePièce traite les espaces comme un symbole spécial afin qu'il fonctionne directement sur le texte brut sans pré-diviser les espaces, idéal pour les langues sans espaces.

Impact stratégique

Vitesse et échelle

Les flux de travail linguistiques peuvent évoluer plus rapidement sans sacrifier la cohérence.

Accès et portée

Il étend l’accès à toutes les langues et styles de communication.

Décisions plus claires

Les équipes peuvent consacrer plus de temps au jugement tandis que l’automatisation gère les répétitions.

L'avenir de la tokenisation des sous-mots

La tokenisation des sous-mots restera dominante car elle est rapide et compacte, mais ses faiblesses, ses divisions gênantes en mathématiques, en code et en scripts rares, ainsi que les coûts inégaux des jetons entre les langues, conduisent la recherche sur des modèles au niveau octet et sans jeton. Attendez-vous à des tokeniseurs plus intelligents, éventuellement appris ou adaptatifs, et à une meilleure équité multilingue afin que le texte non anglais ne soit pas pénalisé avec beaucoup plus de jetons par phrase.

Mise en œuvre dans le monde réel

BERT utilise la tokenisation WordPièce, marquant les éléments de continuation comme « ##ing » pour reconstruire les mots originaux.

T5 et de nombreux modèles multilingues utilisent SentencePièce, qui gère directement les langues sans espace comme le japonais.

Les modèles de chat divisent un terme technique rare en fragments connus au lieu d'échouer sur un mot inconnu.

Les tokeniseurs partagent des sous-mots entre « run », « running » et « runner », permettant au modèle de généraliser efficacement la morphologie.

Risques et garde-fous

Les faits hallucinés peuvent discrètement entrer dans des rapports, des flux de support ou des résultats de recherche.

La sensibilité des invites peut créer des résultats incohérents pour des demandes similaires.

Les données textuelles sensibles peuvent être exposées si les contrôles d’accès sont faibles.

Feuille de route de mise en œuvre

1

Définissez le format de sortie, le ton et les normes de qualité avant le déploiement.

2

Établissez des réponses auprès de sources fiables chaque fois que la précision est importante.

3

Gardez un point de contrôle d’examen humain pour les résultats à enjeux élevés.

4

Suivez les modèles de défaillance et recyclez régulièrement les invites ou les flux de travail.

Continuez à explorer

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Subword Tokenization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Démarrer le quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Guide suivant

Tokenisation de SentencePièce

Questions fréquemment posées

What is Subword Tokenization?

La tokenisation des sous-mots divise le texte en unités plus petites que les mots mais plus grandes que les caractères, comme « jeton » plus « isation ». C'est la manière standard dont les modèles de langage modernes transforment le texte en identifiants discrets qu'ils traitent réellement, en équilibrant la taille du vocabulaire et le sens.

Quel problème la tokenisation des sous-mots résout-elle par rapport à l'utilisation de mots entiers ?

Les vocabulaires de mots entiers sont énormes et manquent encore de mots rares ; les sous-mots maintiennent les vocabulaires gérables et divisent gracieusement les mots inconnus.

Lequel de ces éléments est un algorithme de tokenisation de sous-mots utilisé par BERT ?

BERT utilise WordPièce, qui sélectionne les fusions qui augmentent le plus la probabilité du corpus de formation.

Comment WordPièce marque-t-il généralement un morceau qui continue un mot ?

WordPièce préfixe les sous-mots internes aux mots avec « ## », donc « jouer » devient « jouer » plus « ##ing ».

Pourquoi SentencePièce est-il bien adapté aux langues comme le japonais ?

SentencePièce fonctionne sur du texte brut et encode les espaces comme un symbole spécial, de sorte qu'il fonctionne même sans espaces entre les mots.

À quoi correspond finalement chaque fragment de sous-mot avant d’atteindre le modèle ?

Chaque sous-mot se voit attribuer un identifiant entier, que la couche d'intégration transforme en un vecteur que le modèle peut traiter.