GUIDE Technique

Modèles basés sur l'énergie

Les modèles basés sur l'énergie (EBM) apprennent une fonction « énergétique » scalaire qui attribue des valeurs faibles aux données plausibles et des valeurs élevées aux données invraisemblables, définissant ainsi une distribution de probabilité sans la forcer à être facile à normaliser.

2 minutes de lectureDernière mise à jour

Aperçu

This flexibility makes them a unifying lens for much of machine learning, from classifiers to generative models.

Plongée profonde

Un modèle basé sur l'énergie définit une probabilité via la distribution de Boltzmann (Gibbs) : p(x) est proportionnel à exp(-E(x)), où E(x) est une fonction énergétique apprise, souvent un réseau de neurones. La formation réduit l’énergie des données réelles et augmente l’énergie de tout le reste. Le piège est la fonction de partition Z, la somme ou l'intégrale de exp(-E(x)) sur toutes les entrées possibles, qui est généralement difficile à calculer. Les EBM sont donc formés avec des approximations : divergence contrastive, correspondance de scores ou estimation de contraste de bruit, et échantillonnés via des méthodes MCMC comme la dynamique de Langevin qui suivent le gradient d'énergie. Les exemples classiques incluent les réseaux Hopfield et les machines Boltzmann restreintes ; les travaux modernes connectent les EBM aux modèles de diffusion, aux GAN et même aux classificateurs ordinaires réinterprétés comme des fonctions énergétiques.

Aperçu technique

Le modèle attribue une probabilité p(x) = exp(-E(x)) / Z. Parce que Z (le normalisateur sur toutes les entrées) est intraitable, vous calculez rarement directement la vraisemblance. Au lieu de cela, l'appariement des scores et l'échantillonnage de Langevin exploitent le fait que le gradient de log p(x) est égal à -gradient de E(x), donc Z disparaît. La dynamique de Langevin génère ensuite des échantillons en poussant à plusieurs reprises x vers le bas en énergie et en ajoutant du bruit, marchant vers des régions à faible énergie et à haute probabilité.

Impact stratégique

Coût et budget

Les décisions en matière d'architecture déterminent les performances et les coûts d'exploitation pendant des années.

Décisions plus claires

La formation technique aide les équipes à choisir la bonne pile, pas seulement la plus récente.

Contrôle qualité

De meilleurs choix d’ingénierie réduisent les incidents de fiabilité en production.

L'avenir des modèles basés sur l'énergie

Les EBM connaissent un regain d'intérêt car ils fournissent un pont théorique entre les modèles de diffusion, les modèles génératifs basés sur des scores et les réseaux discriminatifs, le score qu'un modèle de diffusion apprend est essentiellement un gradient d'énergie. Attendez-vous à davantage de systèmes hybrides utilisant des fonctions énergétiques pour des contraintes flexibles et composables (combinant plusieurs énergies pour diriger la génération), à un échantillonnage meilleur et plus rapide que MCMC, et à des applications de raisonnement et de planification où « trouver la configuration la plus basse énergie » exprime naturellement l'optimisation et la satisfaction des contraintes.

Mise en œuvre dans le monde réel

Réseaux Hopfield agissant comme une mémoire associative qui rappelle un modèle stocké à partir d'une entrée bruyante ou partielle en s'installant dans un état de faible énergie

Machines Boltzmann restreintes utilisées historiquement pour le filtrage collaboratif et la pré-formation des réseaux de croyances profondes

Réinterpréter un classificateur standard en tant que modèle basé sur l'énergie (l'approche JEM) pour améliorer l'étalonnage, la robustesse et la détection hors distribution

Prédiction structurée et satisfaction des contraintes, où les solutions sont trouvées en minimisant une énergie apprise sur de nombreuses variables en interaction (par exemple, estimation de pose ou disposition)

Risques et garde-fous

L’optimisation d’un benchmark peut masquer des faiblesses plus larges du système.

Les coûts d’infrastructure et de maintenance sont souvent sous-estimés.

Les lacunes en matière de sécurité et d’observabilité peuvent se creuser à mesure que les systèmes deviennent plus complexes.

Feuille de route de mise en œuvre

1

Définissez les objectifs de latence, de qualité et de coût avant la mise en œuvre.

2

Benchmark dans des conditions de charge et de données réalistes.

3

Surveillance des instruments pour détecter les erreurs, la dérive et l'impact sur l'utilisateur.

4

Préparez les chemins de restauration et de réponse aux incidents avant la mise à l’échelle.

Continuez à explorer

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Energy-Based Models quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Démarrer le quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Guide suivant

Modèles génératifs basés sur les scores

Questions fréquemment posées

What is Energy-Based Models?

Les modèles basés sur l'énergie (EBM) apprennent une fonction « énergétique » scalaire qui attribue des valeurs faibles aux données plausibles et des valeurs élevées aux données invraisemblables, définissant ainsi une distribution de probabilité sans la forcer à être facile à normaliser. Cette flexibilité en fait une lentille unificatrice pour une grande partie de l’apprentissage automatique, des classificateurs aux modèles génératifs.

Dans un modèle basé sur l'énergie, quel est le lien entre l'énergie et la probabilité d'un point de données ?

Via la distribution de Boltzmann, p(x) est proportionnel à exp(-E(x)), donc les données plausibles se voient attribuer une faible énergie et une probabilité élevée.

Qu’est-ce qui rend difficile la formation de modèles basés sur l’énergie ?

Le calcul de Z nécessite de additionner ou d'intégrer exp(-E(x)) sur tout l'espace d'entrée, ce qui est généralement irréalisable, ce qui oblige à des méthodes de formation approximatives.

Quelle méthode d’échantillonnage est couramment utilisée pour prélever des échantillons à partir d’un EBM ?

La dynamique de Langevin déplace de manière itérative les échantillons vers le bas le long du gradient d'énergie tout en ajoutant du bruit, convergeant vers les régions à faible énergie.

Pourquoi des méthodes telles que la correspondance de scores peuvent-elles éviter de calculer la fonction de partition Z ?

Puisque Z ne dépend pas de x, différencier log p(x) par rapport à x l'annule, ne laissant que le gradient d'énergie, qui est traitable.

Lequel de ces modèles est un modèle énergétique classique ?

Les réseaux Hopfield sont un des premiers modèles basés sur l'énergie qui stockent des modèles sous forme d'états à faible énergie et les rappellent en minimisant l'énergie.