GUIDE Technique

Bandits multi-armés

Un bandit à plusieurs bras est un problème de décision dans lequel vous choisissez à plusieurs reprises parmi des options aux gains inconnus et apprenez au fur et à mesure, en équilibrant l'exploration de nouvelles options et l'exploitation de la meilleure trouvée.

2 minutes de lectureDernière mise à jour

Aperçu

It powers A/B testing, recommendations, and online ad selection.

Plongée profonde

Le nom vient d'un joueur confronté à plusieurs machines à sous (bandits manchots), chacune avec un taux de gain inconnu, qui souhaite maximiser sa récompense sur de nombreux tirages. La tension centrale est le compromis explorer-exploiter : continuez à tirer le bras qui vous convient le mieux ou échantillonnez les bras incertains pour en savoir plus. La performance est mesurée par le regret, l'écart cumulé entre vos récompenses et le fait de toujours choisir le meilleur bras ; les bons algorithmes obtiennent un regret qui n'augmente que de manière logarithmique en fonction du nombre de tours. Les stratégies classiques incluent l'epsilon-gourmand (exploiter, mais explorer au hasard avec une faible probabilité), l'Upper Confidence Bound (choisir le bras avec l'estimation optimiste la plus élevée) et l'échantillonnage de Thompson (échantillonner la croyance postérieure de chaque bras et jouer le gagnant). Les bandits contextuels étendent cela en utilisant les caractéristiques de la situation pour choisir.

Aperçu technique

UCB incarne « l'optimisme dans l'incertitude » : il ajoute un bonus de confiance, à peu près la racine carrée de (2 lnt sur n_i), à la récompense moyenne de chaque bras, où t est le tour et n_i les fois où le bras i a été essayé. Les bras rarement tirés obtiennent un gros bonus et sont explorés ; les armes bien échantillonnées reposent sur leur estimation. L'échantillonnage de Thompson maintient plutôt un postérieur bayésien par bras et explore proportionnellement à la probabilité que chaque bras soit optimal.

Impact stratégique

Coût et budget

Les décisions en matière d'architecture déterminent les performances et les coûts d'exploitation pendant des années.

Décisions plus claires

La formation technique aide les équipes à choisir la bonne pile, pas seulement la plus récente.

Contrôle qualité

De meilleurs choix d’ingénierie réduisent les incidents de fiabilité en production.

L’avenir des bandits multi-armés

Les bandits se répandent dans l'apprentissage par renforcement, où ils constituent l'élément de base le plus simple, et dans la personnalisation à grande échelle avec des bandits contextuels et neuronaux qui lisent des fonctionnalités riches. La recherche active cible les récompenses non stationnaires qui dérivent dans le temps, les bandits avec des contraintes de sécurité ou d'équité, et combine les bandits avec un apprentissage de représentation approfondi. Attendez-vous à ce qu'ils soient intégrés dans des essais cliniques adaptatifs, une tarification dynamique et des systèmes LLM qui choisissent des invites ou des outils en ligne tout en contrôlant les regrets.

Mise en œuvre dans le monde réel

Un site d'actualités utilise des bandits pour décider quelle variante de titre afficher, déplaçant rapidement le trafic vers la version qui génère le plus de clics.

Une plate-forme publicitaire en ligne répartit les impressions entre les créations avec un échantillonnage Thompson pour maximiser les clics tout en testant de nouvelles publicités.

Un essai clinique adaptatif affecte davantage de patients à des traitements montrant de meilleurs résultats, réduisant ainsi l'exposition aux bras inférieurs.

Un service de streaming ajuste les vignettes de recommandation par utilisateur avec des bandits contextuels qui lisent les fonctionnalités de l'historique de visualisation.

Risques et garde-fous

L’optimisation d’un benchmark peut masquer des faiblesses plus larges du système.

Les coûts d’infrastructure et de maintenance sont souvent sous-estimés.

Les lacunes en matière de sécurité et d’observabilité peuvent se creuser à mesure que les systèmes deviennent plus complexes.

Feuille de route de mise en œuvre

1

Définissez les objectifs de latence, de qualité et de coût avant la mise en œuvre.

2

Benchmark dans des conditions de charge et de données réalistes.

3

Surveillance des instruments pour détecter les erreurs, la dérive et l'impact sur l'utilisateur.

4

Préparez les chemins de restauration et de réponse aux incidents avant la mise à l’échelle.

Continuez à explorer

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Multi-Armed Bandits quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Démarrer le quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Guide suivant

Streaming spéculatif et prédiction multi-jetons

Questions fréquemment posées

What is Multi-Armed Bandits?

Un bandit à plusieurs bras est un problème de décision dans lequel vous choisissez à plusieurs reprises parmi des options aux gains inconnus et apprenez au fur et à mesure, en équilibrant l'exploration de nouvelles options et l'exploitation de la meilleure trouvée. Il alimente les tests A/B, les recommandations et la sélection d'annonces en ligne.

What is next for Multi-Armed Bandits?

Les bandits se répandent dans l'apprentissage par renforcement, où ils constituent l'élément de base le plus simple, et dans la personnalisation à grande échelle avec des bandits contextuels et neuronaux qui lisent des fonctionnalités riches. La recherche active cible les récompenses non stationnaires qui dérivent dans le temps, les bandits avec des contraintes de sécurité ou d'équité, et combine les bandits avec un apprentissage de représentation approfondi. Attendez-vous à ce qu'ils soient intégrés dans des essais cliniques adaptatifs, une tarification dynamique et des systèmes LLM qui choisissent des invites ou des outils en ligne tout en contrôlant les regrets.

À quoi sert la stratégie epsilon-gourmande ?

Epsilon-greedy exploite la plupart du temps le meilleur bras actuel et explore un bras aléatoire avec une faible probabilité epsilon.

En quoi un bandit contextuel diffère-t-il d’un bandit standard ?

Les bandits contextuels observent les informations secondaires (caractéristiques) de chaque tour et les utilisent pour choisir la meilleure arme pour ce contexte.