GUIDE des fondamentaux

Apprentissage par transfert

L'apprentissage par transfert réutilise un modèle déjà formé sur un grand ensemble de données et l'adapte à une nouvelle tâche connexe.

2 minutes de lectureDernière mise à jour

Aperçu

Instead of starting from scratch, you stand on the shoulders of a model that already learned useful general features, saving enormous time, data, and compute.

Plongée profonde

La formation d'un modèle solide à partir de zéro nécessite souvent des millions d'exemples étiquetés et du matériel sérieux. L’apprentissage par transfert évite cela. Un modèle pré-entraîné sur un énorme ensemble de données, tel qu'un réseau d'images formé sur ImageNet ou un modèle de langage formé sur du texte Web, a déjà appris des modèles largement utiles : bords et formes pour la vision, grammaire et signification pour le texte. Vous prenez ce modèle pré-entraîné et adaptez ses connaissances à votre problème spécifique plus petit. Il existe deux styles principaux. Lors de l'extraction de fonctionnalités, vous gèlez la majeure partie du réseau et entraînez uniquement une nouvelle couche de sortie par-dessus. Lors du réglage fin, vous débloquez également certaines couches plus profondes et continuez à les entraîner à un faible taux d'apprentissage afin que le modèle s'adapte en douceur à vos données sans oublier ce qu'il savait.

Aperçu technique

Les réseaux pré-entraînés apprennent une hiérarchie : les premières couches capturent les caractéristiques génériques (bords, textures, relations de base entre les mots) tandis que les couches ultérieures capturent les concepts spécifiques aux tâches. L’apprentissage par transfert exploite cela. Si votre tâche est similaire à l'original, gelez les premières couches en tant qu'extracteur de fonctionnalités fixes et recyclez uniquement la tête. Si vos données diffèrent davantage, affinez les couches plus profondes en utilisant un très faible taux d'apprentissage afin que les mises à jour soient douces. Le gros risque est le changement de domaine : si les nouvelles données semblent trop différentes des données de pré-entraînement, les fonctionnalités empruntées s'adaptent mal.

Impact stratégique

Décisions plus claires

Il vous aide à séparer les affirmations techniques claires du langage marketing.

Coût et budget

Vous pouvez poser de meilleures questions de mise en œuvre avant de dépenser de l'argent ou du temps.

Équipe et flux de travail

Les équipes partageant une compréhension commune prennent de meilleures décisions en matière de produits, de politiques et d’apprentissage.

L’avenir de l’apprentissage par transfert

L’apprentissage par transfert est devenu la méthode par défaut de construction de l’IA. Aujourd’hui, presque personne ne forme une vision large ou un modèle de langage à partir de zéro ; les équipes adaptent plutôt un modèle de base pré-entraîné. La frontière réside dans les méthodes efficaces en termes de paramètres telles que LoRA et les adaptateurs, qui ne modifient qu'une infime fraction des poids pour personnaliser des modèles géants à moindre coût. Attendez-vous à ce que cette tendance s'approfondisse : des modèles plus petits et spécialisés distillés et affinés à partir de modèles plus grands, ainsi qu'une attention croissante à l'atténuation des changements de domaine et à la prévention d'un « oubli catastrophique » lorsqu'un modèle est adapté à plusieurs reprises.

Mise en œuvre dans le monde réel

Affiner un réseau pré-entraîné ImageNet pour détecter des défauts spécifiques sur une ligne de production en usine avec seulement quelques milliers de photos

Adapter un grand modèle linguistique pré-entraîné pour rédiger des résumés juridiques ou médicaux en affinant sur un corpus spécialisé plus petit

Utiliser un modèle formé sur le discours général comme point de départ pour créer un outil de reconnaissance pour un accent ou un dialecte spécifique

Recyclage de la couche finale d'un modèle de vision pour classer les maladies des plantes à partir d'images de feuilles pour une application agricole

Risques et garde-fous

Différentes équipes peuvent utiliser le même terme différemment, alors définissez la portée dès le début.

Les benchmarks peuvent paraître solides alors que les performances réelles sont inégales.

Ignorer la qualité des données et les plans d’évaluation crée souvent des résultats fragiles.

Feuille de route de mise en œuvre

1

Commencez par une définition en langage simple du résultat dont vous avez besoin.

2

Choisissez une mesure de réussite et une condition d’échec avant de tester.

3

Exécutez un petit pilote avec des données représentatives, pas un ensemble de démonstration raffiné.

4

Documentez où l'apprentissage par transfert est utile et où les méthodes plus simples sont meilleures.

Continuez à explorer

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Transfer Learning quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Démarrer le quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Guide suivant

Apprentissage semi-supervisé

Questions fréquemment posées

What is Transfer Learning?

L'apprentissage par transfert réutilise un modèle déjà formé sur un grand ensemble de données et l'adapte à une nouvelle tâche connexe. Au lieu de repartir de zéro, vous vous appuyez sur un modèle qui a déjà appris des fonctionnalités générales utiles, économisant ainsi énormément de temps, de données et de calcul.

Quelle est l’idée centrale de l’apprentissage par transfert ?

L'apprentissage par transfert prend un modèle qui a déjà appris les fonctionnalités générales et l'adapte, économisant ainsi des données, du temps et des calculs.

Pourquoi utilisez-vous un taux d'apprentissage très faible lors du réglage fin des couches plus profondes ?

Les mises à jour volumineuses sur un petit ensemble de données peuvent écraser des fonctionnalités pré-entraînées précieuses et être rapidement surajustées, de sorte que les mises à jour restent petites.

Quelle situation est la MEILLEURE solution pour l’extraction de caractéristiques simples (gel de la base) ?

Lorsque la tâche cible est proche de l'originale et que les données sont limitées, les fonctionnalités gelées sont déjà pertinentes, vous n'avez donc besoin que d'une nouvelle tête.

Quel problème le « changement de domaine » décrit-il dans l'apprentissage par transfert ?

Si le domaine cible semble très différent de celui sur lequel le modèle a été pré-entraîné, les fonctionnalités réutilisées risquent de ne pas être correctement transférées et la précision diminue.

Pourquoi les premières couches d'un réseau pré-entraîné sont-elles souvent réutilisées plus facilement que les couches ultérieures ?

Les premières couches capturent des modèles de bas niveau largement utiles, tandis que les couches ultérieures sont plus spécialisées dans la tâche d'origine.