GUIDE DE L'IA Visuelle

Distance de départ de Fréchet

La distance de création de Fréchet (FID) est la mesure standard pour juger du réalisme et de la diversité d'un ensemble d'images générées.

2 minutes de lectureDernière mise à jour

Aperçu

It compares the statistics of real and generated images in a deep feature space — lower scores mean the fakes look closer to the real thing.

Plongée profonde

FID, introduit par Heusel et al. en 2017, a corrigé un défaut clé du précédent Inception Score : il ne comparait jamais les images générées aux données réelles réelles. FID alimente les images réelles et générées via un réseau Inception-v3 pré-entraîné et lit un vecteur de caractéristiques de 2048 dimensions à partir d'une couche de pooling profonde pour chaque image. Il modélise ensuite chaque ensemble de caractéristiques comme une gaussienne multivariée, les résumant par un vecteur moyen et une matrice de covariance. La distance entre les deux gaussiennes est calculée avec la distance de Fréchet (également appelée distance 2-Wasserstein). Un FID inférieur signifie que la moyenne et la répartition de la distribution générée correspondent étroitement aux images réelles, capturant à la fois la fidélité (ont-elles l'air réelles ?) et la diversité (couvrent-elles la variété des données réelles ?).

Aperçu technique

La formule FID est la différence carrée des deux vecteurs moyens plus la trace de (somme des covariances moins deux fois la racine carrée matricielle de leur produit). Parce qu'il utilise une covariance totale, le FID pénalise à la fois les sorties floues et irréalistes et l'effondrement des modes lorsqu'un modèle produit trop peu de variété. Il est sensible à la taille de l’échantillon – trop peu d’images biaisent l’estimation à la hausse – de sorte que les praticiens le calculent généralement sur des dizaines de milliers d’images, souvent 50 000.

Impact stratégique

Vitesse et échelle

L’IA visuelle peut automatiser les tâches d’inspection, de détection et de marquage à grande échelle.

Choix de construction

Les équipes créatives peuvent prototyper des concepts plus rapidement avec moins de révisions manuelles.

Équipe et flux de travail

Les opérations peuvent utiliser des signaux d’image et vidéo qui étaient auparavant difficiles à traiter.

L’avenir de Fréchet Inception Distance

Le FID reste la valeur par défaut du domaine, mais ses faiblesses conduisent à des alternatives. Les chercheurs ont montré qu'il hérite des biais ImageNet d'Inception-v3 et peut être en désaccord avec le jugement humain, ce qui entraîne des métriques telles que le FID calculé sur les fonctionnalités CLIP (parfois appelées FDD ou CMMD), la distance de début du noyau (KID) pour les petits échantillons et des métriques de précision/rappel qui séparent la fidélité de la diversité. Attendez-vous à une évaluation plus riche, indépendante des fonctionnalités et alignée sur la perception, d'autant plus que la génération de texte en image et en vidéo dépasse les résumés à numéro unique.

Mise en œuvre dans le monde réel

Analyse comparative des GAN tels que StyleGAN, où les équipes rapportent le FID sur des ensembles de données comme FFHQ pour comparer la qualité de génération de visages.

Suivi de la progression de la formation d'un modèle de diffusion en calculant le FID aux points de contrôle pour voir quand la qualité de l'image cesse de s'améliorer.

Comparaison de modèles texte-image concurrents sur l'ensemble de données COCO, où un FID inférieur est cité comme preuve de résultats plus réalistes.

Détection de l'effondrement des modes dans un générateur, puisque le terme de covariance du FID augmente lorsque le modèle produit trop peu de diversité d'image.

Risques et garde-fous

Les droits à l’image et le consentement peuvent devenir des risques juridiques si la provenance n’est pas claire.

Les performances du modèle peuvent varier en fonction de l'éclairage, des données démographiques et des environnements.

Les faux positifs peuvent passer inaperçus si les seuils de confiance ne sont pas surveillés.

Feuille de route de mise en œuvre

1

Définissez des critères d’acceptation pour la précision, le rappel et les coûts d’erreur.

2

Testez avec des données qui correspondent aux conditions de production réelles.

3

Ajoutez un examen humain pour les prédictions peu fiables ou à fort impact.

4

Suivez la dérive du modèle et revalidez après les modifications de la caméra ou de l’ensemble de données.

Continuez à explorer

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Fréchet Inception Distance quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Démarrer le quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Guide suivant

Fonctions de distance signée

Questions fréquemment posées

What is Fréchet Inception Distance?

La distance de création de Fréchet (FID) est la mesure standard pour juger du réalisme et de la diversité d'un ensemble d'images générées. Il compare les statistiques des images réelles et générées dans un espace de fonctionnalités approfondi : des scores plus faibles signifient que les contrefaçons se rapprochent de la réalité.

Qu’indique un score FID inférieur ?

FID mesure la distance entre les distributions de caractéristiques réelles et générées, donc une valeur inférieure signifie que l'ensemble généré correspond plus étroitement aux données réelles en termes de fidélité et de diversité.

Quel réseau pré-entraîné le FID standard utilise-t-il pour extraire les caractéristiques de l'image ?

FID transmet les images via un réseau Inception-v3 pré-entraîné et utilise ses fonctionnalités de couche de regroupement à 2048 dimensions pour les images réelles et générées.

Comment FID résume-t-il chaque ensemble de caractéristiques de l’image avant de les comparer ?

Chaque ensemble de caractéristiques est modélisé comme une gaussienne multivariée et FID calcule la distance de Fréchet (2-Wasserstein) entre les deux gaussiennes.

Quelle lacune clé du score initial le FID a-t-il comblé ?

Le score d'Inception n'évaluait que les images générées de manière isolée ; FID l'a amélioré en comparant directement les distributions d'images générées et réelles.

Pourquoi le FID augmente-t-il lorsqu'un générateur souffre d'un effondrement de mode ?

Le FID utilise la covariance totale des caractéristiques. Ainsi, lorsqu'un modèle produit trop peu de variété, sa répartition s'écarte des données réelles, ce qui fait augmenter le score.