GUIDE des fondamentaux

Apprentissage actif

L'apprentissage actif est une stratégie de formation dans laquelle le modèle lui-même choisit les exemples non étiquetés qu'un humain doit ensuite étiqueter.

2 minutes de lectureDernière mise à jour

Aperçu

It matters because labeling data is expensive, and smart selection can reach high accuracy with a fraction of the annotations.

Plongée profonde

La plupart des apprentissages supervisés supposent que vous disposez déjà d’une grande quantité de données étiquetées. L'apprentissage actif inverse cela : vous commencez avec un petit ensemble étiqueté et un grand nombre d'exemples non étiquetés, puis demandez à plusieurs reprises à un humain (l'« oracle ») d'étiqueter uniquement les plus informatifs. Le modèle est entraîné, utilisé pour évaluer le pool non étiqueté, et les exemples de valeur la plus élevée sont envoyés pour étiquetage, puis la boucle se répète. Les stratégies de sélection courantes incluent l'échantillonnage d'incertitude (choisissez les exemples sur lesquels le modèle est le moins sûr), la requête par comité (choisissez les points où un ensemble n'est pas d'accord) et l'échantillonnage de diversité (couvrez diverses régions des données). Bien réalisé, l’apprentissage actif peut correspondre à la précision d’un ensemble de données complet en utilisant beaucoup moins d’étiquettes, c’est pourquoi il est populaire dans l’imagerie médicale, la PNL et tout domaine où l’annotation par des experts est lente ou coûteuse.

Aperçu technique

L'idée centrale est d'estimer la « valeur » de chaque point non étiqueté avant de payer pour l'étiqueter. L'échantillonnage d'incertitude utilise les propres probabilités du modèle, par exemple en choisissant le point dont la probabilité de classe supérieure est la plus proche du hasard, ou avec l'entropie la plus élevée ou la plus petite marge entre les deux classes supérieures. La requête par comité forme plusieurs modèles et sélectionne les points sur lesquels ils sont le plus en désaccord. L’un des principaux risques est le biais d’échantillonnage : la poursuite avide de l’incertitude peut ignorer des régions entières, de sorte que les méthodes tenant compte de la diversité ou des lots sont souvent combinées.

Impact stratégique

Décisions plus claires

Il vous aide à séparer les affirmations techniques claires du langage marketing.

Coût et budget

Vous pouvez poser de meilleures questions de mise en œuvre avant de dépenser de l'argent ou du temps.

Équipe et flux de travail

Les équipes partageant une compréhension commune prennent de meilleures décisions en matière de produits, de politiques et d’apprentissage.

L'avenir de l'apprentissage actif

L'apprentissage actif est de plus en plus associé à de grands modèles de pré-entraînement et de base, où l'objectif passe de l'étiquetage de tout à l'ajustement à moindre coût de quelques exemples de grande valeur. Attendez-vous à une intégration plus étroite avec une supervision faible, une pré-formation auto-supervisée et des outils humains dans la boucle qui suggèrent des étiquettes que les évaluateurs doivent confirmer plutôt que créer. Alors que les coûts d’étiquetage dominent de nombreux déploiements réels, la sélection automatisée et les interfaces d’annotation efficaces resteront essentielles à la création de modèles dans des domaines spécialisés et rares en données comme la médecine et le droit.

Mise en œuvre dans le monde réel

Une équipe de radiologie forme un détecteur de tumeur en demandant au modèle de signaler les analyses les plus ambiguës pour que les radiologues experts puissent les étiqueter, réduisant ainsi considérablement les heures d'annotation.

Un système de spam ou de modération de contenu fait apparaître des messages limites dont il est le moins sûr pour les évaluateurs humains, s'améliorant plus rapidement dans les cas extrêmes.

Une entreprise de reconnaissance vocale sélectionne les clips audio dont le modèle est le plus incertain (accents, bruit) pour les envoyer à la transcription, plutôt que d'étiqueter les clips au hasard.

Un catalogue de commerce électronique utilise la requête par comité pour sélectionner les images de produits sur lesquelles plusieurs classificateurs ne sont pas d'accord, en les priorisant pour un étiquetage manuel des catégories.

Risques et garde-fous

Différentes équipes peuvent utiliser le même terme différemment, alors définissez la portée dès le début.

Les benchmarks peuvent paraître solides alors que les performances réelles sont inégales.

Ignorer la qualité des données et les plans d’évaluation crée souvent des résultats fragiles.

Feuille de route de mise en œuvre

1

Commencez par une définition en langage simple du résultat dont vous avez besoin.

2

Choisissez une mesure de réussite et une condition d’échec avant de tester.

3

Exécutez un petit pilote avec des données représentatives, pas un ensemble de démonstration raffiné.

4

Documentez les domaines dans lesquels l'apprentissage actif est utile et les domaines dans lesquels les méthodes plus simples sont préférables.

Continuez à explorer

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Active Learning quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Démarrer le quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Guide suivant

Apprentissage profond

Questions fréquemment posées

What is Active Learning?

L'apprentissage actif est une stratégie de formation dans laquelle le modèle lui-même choisit les exemples non étiquetés qu'un humain doit ensuite étiqueter. C’est important car l’étiquetage des données coûte cher et une sélection intelligente peut atteindre une grande précision avec une fraction des annotations.

Quel est l’objectif principal de l’apprentissage actif ?

L'apprentissage actif vise à maximiser les performances du modèle par exemple étiqueté en choisissant les points les plus informatifs à annoter par un humain.

En apprentissage actif, qu'est-ce que « l'oracle » ?

L'oracle est la source d'étiquetage - généralement un expert humain - que le modèle interroge pour obtenir des étiquettes de vérité terrain sur des exemples sélectionnés.

Quelle stratégie sélectionne les exemples sur lesquels le modèle a le moins confiance ?

L'échantillonnage d'incertitude sélectionne les points où les probabilités prédites par le modèle sont les plus proches d'une supposition, comme une entropie élevée ou une petite marge entre les classes supérieures.

Comment la requête par comité décide-t-elle quels exemples étiqueter ?

La requête par comité forme un ensemble et priorise les points sur lesquels les membres ne sont pas d'accord, car un désaccord signale des régions informatives.

Quel est le principal risque lié au fait de s’appuyer uniquement sur un échantillonnage d’incertitude ?

La poursuite avide de points incertains peut se concentrer excessivement sur une région et en manquer d’autres, c’est pourquoi des méthodes tenant compte de la diversité ou des lots sont souvent ajoutées.