GUIDE des fondamentaux

Cellules de mémoire à long terme et à court terme

Les cellules LSTM (Long Short-Term Memory) sont un type spécial d’unité de réseau neuronal récurrent conçue pour mémoriser des informations sur de longues séquences.

2 minutes de lectureDernière mise à jour

Aperçu

They solved the vanishing-gradient problem that crippled earlier RNNs, powering a decade of breakthroughs in language, speech, and translation.

Plongée profonde

Introduite par Sepp Hochreiter et Jurgen Schmidhuber en 1997, la cellule LSTM maintient un « état cellulaire » qui agit comme un tapis roulant de mémoire parcourant la séquence. Trois portes apprises le contrôlent : la porte d'oubli décide ce qu'il faut effacer, la porte d'entrée décide quelles nouvelles informations stocker et la porte de sortie décide ce qu'il faut exposer comme sortie de la cellule. Chaque porte utilise un sigmoïde (sortie de 0 à 1) pour agir comme un commutateur logiciel. Étant donné que l'état de la cellule est mis à jour principalement par addition plutôt que par multiplication répétée, les gradients peuvent revenir en arrière sur plusieurs pas de temps sans se réduire à zéro, permettant aux LSTM d'apprendre des dépendances à des centaines de pas d'intervalle. Avant Transformers, les LSTM étaient à la base de Google Translate, de la reconnaissance vocale et de la génération de texte.

Aperçu technique

Le correctif du gradient de disparition provient de la mise à jour quasi-linéaire de l'état de la cellule : c_t = f_t * c_{t-1} + i_t * g_t. La porte d'oubli f_t (un sigmoïde) peut rester proche de 1, créant un « carrousel d'erreurs constantes » afin que les signaux d'erreur survivent à la rétropropagation dans le temps sur de longues périodes. Les portes sont elles-mêmes de petites couches neuronales (sigmoïde pour le déclenchement, tanh pour les valeurs candidates), toutes entraînées conjointement par descente de gradient. Ce contrôle permet au réseau d'apprendre ce qu'il faut conserver et ce qu'il faut supprimer.

Impact stratégique

Décisions plus claires

Il vous aide à séparer les affirmations techniques claires du langage marketing.

Coût et budget

Vous pouvez poser de meilleures questions de mise en œuvre avant de dépenser de l'argent ou du temps.

Équipe et flux de travail

Les équipes partageant une compréhension commune prennent de meilleures décisions en matière de produits, de politiques et d’apprentissage.

L’avenir des cellules mémoire à long terme

Les transformateurs ont largement dépassé les LSTM pour les tâches linguistiques à grande échelle, car ils se parallélisent sur une séquence et capturent le contexte à longue portée via l'attention, tandis que les LSTM traitent les jetons une étape à la fois. Néanmoins, les LSTM restent utiles pour les paramètres de streaming, de faible latence et de ressources limitées, ainsi que pour les données de séries chronologiques modestes. Des travaux récents comme xLSTM (2024) revisitent et modernisent l'architecture avec de nouveaux gates et de nouvelles mémoires pour rivaliser à grande échelle, montrant que l'idée n'est pas terminée.

Mise en œuvre dans le monde réel

Alimenter la traduction automatique au début du système neuronal de Google Translate avant que Transformers ne prenne le relais.

Reconnaissance parole-texte dans les assistants vocaux et les logiciels de dictée.

Prédire les valeurs futures dans des séries chronologiques telles que la demande d'énergie, les relevés de capteurs ou les cours des actions.

Génération de texte ou de musique un jeton à la fois et séquences de saisie semi-automatique.

Risques et garde-fous

Différentes équipes peuvent utiliser le même terme différemment, alors définissez la portée dès le début.

Les benchmarks peuvent paraître solides alors que les performances réelles sont inégales.

Ignorer la qualité des données et les plans d’évaluation crée souvent des résultats fragiles.

Feuille de route de mise en œuvre

1

Commencez par une définition en langage simple du résultat dont vous avez besoin.

2

Choisissez une mesure de réussite et une condition d’échec avant de tester.

3

Exécutez un petit pilote avec des données représentatives, pas un ensemble de démonstration raffiné.

4

Documentez où les cellules de mémoire à long terme et à court terme sont utiles et où les méthodes plus simples sont meilleures.

Continuez à explorer

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Long Short-Term Memory Cells quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Démarrer le quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Guide suivant

Gestion et fragmentation de la mémoire GPU

Questions fréquemment posées

What is Long Short-Term Memory Cells?

Les cellules LSTM (Long Short-Term Memory) sont un type spécial d’unité de réseau neuronal récurrent conçue pour mémoriser des informations sur de longues séquences. Ils ont résolu le problème du gradient de disparition qui paralysait les RNN précédents, alimentant ainsi une décennie de percées dans le domaine du langage, de la parole et de la traduction.

Quelles sont les trois portes qui contrôlent le flux d’informations dans une cellule LSTM standard ?

Un LSTM utilise une porte d'oubli (quoi effacer), une porte d'entrée (quoi stocker) et une porte de sortie (quoi exposer), chacune étant un sigmoïde appris.

Quel problème majeur avec les RNN antérieurs les LSTM ont-ils résolu ?

Les RNN standard souffrent de gradients de disparition qui empêchent l'apprentissage de dépendances à longue portée ; l'état cellulaire additif du LSTM permet aux gradients de persister.

Qui a introduit le LSTM et en quelle année ?

Sepp Hochreiter et Jurgen Schmidhuber ont publié le LSTM en 1997.

Pourquoi l’état cellulaire LSTM aide-t-il les gradients à survivre sur de nombreux pas de temps ?

La mise à jour additive (le « carrousel d'erreurs constantes ») évite les multiplications répétées qui réduisent les gradients, de sorte que les signaux d'erreur reviennent sur de longues périodes.

Quelle fonction d'activation les portails LSTM utilisent-ils généralement pour agir comme des interrupteurs marche/arrêt progressifs ?

Les portes utilisent un sigmoïde, dont la sortie 0 à 1 met à l'échelle la quantité d'informations transmises, agissant comme un commutateur logiciel.