Modèles génératifs basés sur les scores
Les modèles génératifs basés sur les scores créent des données en apprenant le gradient de la distribution des données – la direction qui fait que tout échantillon bruyant ressemble davantage à des données réelles.
Aperçu
This score-function view unifies diffusion models with stochastic differential equations and underpins many modern image generators.
Plongée profonde
Au lieu de modéliser directement la probabilité, les modèles basés sur les scores apprennent le score : le gradient de la densité log-probabilité par rapport à l'entrée. Savoir de quelle manière pousser un échantillon pour augmenter sa probabilité suffit pour générer de nouvelles données. Les travaux de Yang Song et Stefano Ermon en 2019 ont formé un réseau pour estimer ce score sur de nombreux niveaux de bruit en utilisant la correspondance de score de débruitage, puis ont généré des échantillons avec la dynamique de Langevin – en parcourant à plusieurs reprises la partition et en ajoutant un peu de bruit. Leur article score-SDE de 2021 a montré que les modèles de diffusion et basés sur les scores sont deux faces du même processus continu décrit par une équation différentielle stochastique. Fondamentalement, chaque SDE possède une ODE de « flux de probabilité » déterministe correspondante qui partage les mêmes marges, permettant des vraisemblances exactes et un échantillonnage rapide.
Aperçu technique
Il est difficile d'estimer directement le score de données propres là où les données sont rares, c'est pourquoi le modèle est formé sur des données perturbées par le bruit gaussien à plusieurs échelles. La correspondance des scores de débruitage donne un objectif maniable : le score de la distribution bruitée est égal à la direction du bruit divisée par la variance du bruit, donc prédire le bruit et prédire le score sont essentiellement la même chose. L'échantillonnage résout le SDE en temps inverse (ou l'ODE à flux de probabilité équivalent) à partir du bruit gaussien pur.
Impact stratégique
Vitesse et échelle
L’IA visuelle peut automatiser les tâches d’inspection, de détection et de marquage à grande échelle.
Choix de construction
Les équipes créatives peuvent prototyper des concepts plus rapidement avec moins de révisions manuelles.
Équipe et flux de travail
Les opérations peuvent utiliser des signaux d’image et vidéo qui étaient auparavant difficiles à traiter.
L'avenir des modèles génératifs basés sur les scores
Le cadre score-SDE est le moteur théorique derrière une grande partie des progrès de l’IA générative. Des solveurs numériques plus rapides, de meilleurs programmes de bruit et l'ODE de flux de probabilité permettent une génération en temps quasi réel et une évaluation exacte de la vraisemblance. La même idée de correspondance de scores se propage au-delà des images dans la conception de structures audio, moléculaires et protéiques, les nuages de points et la simulation scientifique, tandis que les modèles de cohérence et de correspondance de flux s'appuient directement sur ces fondations en temps continu pour réduire la génération à une poignée d'étapes.
Mise en œuvre dans le monde réel
Réseaux de scores conditionnels au bruit (NCSN) générant des visages photoréalistes en suivant les gradients de scores appris via la dynamique de Langevin.
Reconstruction d'images médicales, comme l'IRM accélérée, où le score appris agit comme un préalable pour remplir les données d'analyse sous-échantillonnées.
Génération de structures moléculaires et protéiques dans la découverte de médicaments, modélisation de configurations atomiques 3D avec diffusion basée sur des scores.
Synthèse de forme d'onde audio où les modèles de partition débruitent vers une parole ou une musique claire, comme dans les vocodeurs basés sur la diffusion.
Risques et garde-fous
Les droits à l’image et le consentement peuvent devenir des risques juridiques si la provenance n’est pas claire.
Les performances du modèle peuvent varier en fonction de l'éclairage, des données démographiques et des environnements.
Les faux positifs peuvent passer inaperçus si les seuils de confiance ne sont pas surveillés.
Feuille de route de mise en œuvre
Définissez des critères d’acceptation pour la précision, le rappel et les coûts d’erreur.
Testez avec des données qui correspondent aux conditions de production réelles.
Ajoutez un examen humain pour les prédictions peu fiables ou à fort impact.
Suivez la dérive du modèle et revalidez après les modifications de la caméra ou de l’ensemble de données.
Continuez à explorer
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Score-Based Generative Models quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Guide suivant
Modèles basés sur l'énergie
Questions fréquemment posées
What is Score-Based Generative Models?
Les modèles génératifs basés sur les scores créent des données en apprenant le gradient de la distribution des données – la direction qui fait que tout échantillon bruyant ressemble davantage à des données réelles. Cette vue fonction de score unifie les modèles de diffusion avec des équations différentielles stochastiques et sous-tend de nombreux générateurs d'images modernes.
Quel est exactement le « score » que ces modèles apprennent ?
Le score est le gradient de la densité des données du journal par rapport à l'entrée : il pointe dans la direction qui augmente la probabilité d'un échantillon.
Pourquoi les modèles basés sur les scores sont-ils formés sur des données corrompues par du bruit à plusieurs échelles ?
Dans les régions à faible densité, le véritable score est mal défini ; les données perturbatrices avec plusieurs niveaux de bruit rendent la correspondance des scores réalisable partout.
Quelle procédure d'échantillonnage les premiers modèles basés sur les scores utilisaient-ils pour générer des données ?
La dynamique de Langevin déplace à plusieurs reprises un échantillon dans la direction de la partition et injecte un petit bruit, transformant progressivement le bruit aléatoire en données réalistes.
Quel lien majeur l’article score-SDE 2021 a-t-il établi ?
Chanson et coll. modèles de diffusion unifiés et basés sur des scores dans un cadre d'équation différentielle stochastique, avec une ODE de flux de probabilité déterministe correspondante.
Quel est le lien entre la prédiction du bruit et la prédiction du score dans la correspondance des scores de débruitage ?
La correspondance des scores de débruitage montre que le score est égal au bruit négatif divisé par la variance du bruit, ce qui fait de la prédiction du bruit et de la prédiction du score le même objectif.