Visuele AI-GIDS

Fréchet-beginafstand

Fréchet Inception Distance (FID) is de standaardmaatstaf om te beoordelen hoe realistisch en gevarieerd een reeks gegenereerde afbeeldingen is.

2 min readLaatst bijgewerkt

Overzicht

It compares the statistics of real and generated images in a deep feature space — lower scores mean the fakes look closer to the real thing.

Diepe duik

FID, geïntroduceerd door Heusel et al. in 2017 werd een belangrijk probleem in de eerdere Inception Score opgelost: de gegenereerde afbeeldingen werden nooit vergeleken met daadwerkelijke echte gegevens. FID voedt zowel echte als gegenereerde afbeeldingen via een vooraf getraind Inception-v3-netwerk en leest voor elke afbeelding een 2048-dimensionale kenmerkvector uit een diepe poolinglaag. Vervolgens modelleert het elke reeks kenmerken als een multivariate Gaussiaans, waarbij ze worden samengevat in een gemiddelde vector- en covariantiematrix. De afstand tussen de twee Gaussianen wordt berekend met de Fréchet-afstand (ook wel de 2-Wasserstein-afstand genoemd). Een lagere FID betekent dat het gemiddelde en de spreiding van de gegenereerde verdeling nauw overeenkomen met echte beelden, waarbij zowel de betrouwbaarheid (zien ze er echt uit?) als de diversiteit (dekken ze de verscheidenheid aan echte gegevens?) worden vastgelegd.

Technisch inzicht

De FID-formule is het kwadraat van het verschil tussen de twee gemiddelde vectoren plus het spoor van (de som van de covarianties minus tweemaal de matrixvierkantswortel van hun product). Omdat het gebruik maakt van volledige covariantie, bestraft FID zowel wazige, onrealistische uitkomsten als het instorten van de modus waarbij een model te weinig variatie produceert. Het is gevoelig voor de steekproefomvang – te weinig afbeeldingen vertekenen de schatting naar boven – dus berekenen praktijkmensen deze doorgaans over tienduizenden afbeeldingen, vaak 50.000.

Strategische impact

Speed and scale

Visuele AI kan inspectie-, detectie- en taggingtaken op schaal automatiseren.

Build choices

Creatieve teams kunnen concepten sneller prototypen met minder handmatige revisies.

Team and workflow

Bij bewerkingen kan gebruik worden gemaakt van beeld- en videosignalen die voorheen moeilijk te verwerken waren.

De toekomst van Fréchet Inception Distance

FID blijft de standaard op dit gebied, maar de zwakheden ervan zorgen voor alternatieven. Onderzoekers hebben aangetoond dat het ImageNet-vooroordelen overneemt van Inception-v3 en het niet eens kan zijn met het menselijk oordeel, wat aanleiding geeft tot statistieken zoals FID berekend op basis van CLIP-functies (soms FDD of CMMD genoemd), Kernel Inception Distance (KID) voor kleine steekproeven, en precisie-/herinneringsstatistieken die betrouwbaarheid scheiden van diversiteit. Verwacht een rijkere, feature-backbone-agnostische en perceptueel afgestemde evaluatie, vooral nu tekst-naar-beeld- en video-generatie de samenvattingen van één cijfer ontgroeit.

Implementatie in de echte wereld

Benchmarking van GAN's zoals StyleGAN, waarbij teams FID rapporteren op datasets zoals FFHQ om de kwaliteit van het genereren van gezichten te vergelijken.

Het volgen van de trainingsvoortgang van een diffusiemodel door FID te berekenen bij controlepunten om te zien wanneer de beeldkwaliteit niet meer verbetert.

Vergelijking van concurrerende tekst-naar-beeldmodellen op de COCO-dataset, waarbij een lagere FID wordt aangehaald als bewijs van meer realistische resultaten.

Het detecteren van instorting van de modus in een generator, omdat de covariantieterm van FID stijgt wanneer het model te weinig beelddiversiteit produceert.

Risico's en vangrails

Beeldrechten en toestemming kunnen juridische risico's worden als de herkomst onduidelijk is.

De prestaties van modellen kunnen variëren afhankelijk van de belichting, demografische gegevens en omgevingen.

Valse positieve resultaten kunnen onopgemerkt blijven, tenzij de vertrouwensdrempels worden gecontroleerd.

Implementatie routekaart

1

Definieer acceptatiecriteria voor precisie-, terugroep- en foutkosten.

2

Test met gegevens die overeenkomen met echte productieomstandigheden.

3

Voeg menselijke beoordeling toe voor voorspellingen met weinig vertrouwen of hoge impact.

4

Volg modelafwijkingen en valideer opnieuw na wijzigingen in de camera of dataset.

Blijf verkennen

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Fréchet Inception Distance quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Ondertekende afstandsfuncties

Frequently asked questions

What is Fréchet Inception Distance?

Fréchet Inception Distance (FID) is de standaardmaatstaf om te beoordelen hoe realistisch en gevarieerd een reeks gegenereerde afbeeldingen is. Het vergelijkt de statistieken van echte en gegenereerde afbeeldingen in een diepe feature-ruimte; lagere scores betekenen dat de vervalsingen dichter bij het echte werk lijken.

Wat betekent een lagere FID-score?

FID meet de afstand tussen echte en gegenereerde kenmerkverdelingen, dus een lagere waarde betekent dat de gegenereerde set beter overeenkomt met echte gegevens wat betreft betrouwbaarheid en diversiteit.

Welk vooraf getrainde netwerk gebruikt de standaard FID om afbeeldingskenmerken te extraheren?

FID geeft afbeeldingen door via een vooraf getraind Inception-v3-netwerk en gebruikt de 2048-dimensionale pooling-laagfuncties voor zowel echte als gegenereerde afbeeldingen.

Hoe vat FID elke reeks beeldkenmerken samen voordat ze worden vergeleken?

Elke functieset wordt gemodelleerd als een multivariate Gaussiaans, en FID berekent de Fréchet (2-Wasserstein) afstand tussen de twee Gaussianen.

Welke belangrijke tekortkoming van de Inception Score heeft FID aangepakt?

De Inception Score evalueerde de gegenereerde afbeeldingen alleen afzonderlijk; FID verbeterde dit door de gegenereerde en echte beelddistributies rechtstreeks te vergelijken.

Waarom stijgt de FID als een generator last heeft van een mode-instorting?

FID maakt gebruik van de volledige covariantie van kenmerken, dus als een model te weinig variatie produceert, wijkt de spreiding af van de echte gegevens, waardoor de score omhoog gaat.