Visual AI GUIDE

Fréchet startavstånd

Fréchet Inception Distance (FID) är standardmåttet för att bedöma hur realistisk och varierad en uppsättning genererade bilder är.

2 min readSenast uppdaterad

Översikt

It compares the statistics of real and generated images in a deep feature space — lower scores mean the fakes look closer to the real thing.

Djupdykning

FID, introducerad av Heusel et al. 2017, åtgärdade en viktig brist i det tidigare startresultatet: det jämförde aldrig genererade bilder med faktiska verkliga data. FID matar både verkliga och genererade bilder genom ett förtränat Inception-v3-nätverk och läser upp en 2048-dimensionell funktionsvektor från ett djupt poolande lager för varje bild. Den modellerar sedan varje uppsättning funktioner som en multivariat Gaussian, och sammanfattar dem med en medelvektor och kovariansmatris. Avståndet mellan de två Gausserna beräknas med Fréchet-avståndet (även kallat 2-Wasserstein-avståndet). En lägre FID betyder att den genererade fördelningens medelvärde och spridning stämmer överens med verkliga bilder, och fångar både trohet (ser de verkliga ut?) och mångfald (täcker de mångfalden av verklig data?).

Teknisk insikt

FID-formeln är den kvadratiska skillnaden mellan de två medelvektorerna plus spåret av (summan av kovarianserna minus två gånger matriskvadratroten av deras produkt). Eftersom den använder full kovarians, straffar FID både suddiga, orealistiska utdata och lägeskollaps där en modell producerar för lite variation. Det är känsligt för urvalsstorlek - för få bilder förvränger uppskattningen uppåt - så utövare beräknar det vanligtvis över tiotusentals bilder, ofta 50 000.

Strategisk inverkan

Speed and scale

Visual AI kan automatisera inspektion, upptäckt och taggningsuppgifter i stor skala.

Build choices

Kreativa team kan prototypa koncept snabbare med färre manuella revisioner.

Team and workflow

Operationer kan använda bild- och videosignaler som tidigare var svåra att bearbeta.

Framtiden för Fréchet Inception Distance

FID förblir fältets standard, men dess svagheter driver alternativen. Forskare har visat att det ärver ImageNet-fördomar från Inception-v3 och kan inte hålla med mänskligt omdöme, vilket leder till mätvärden som FID beräknad på CLIP-funktioner (ibland kallad FDD eller CMMD), Kernel Inception Distance (KID) för små prover och precisions-/återkallningsmått som skiljer trohet från mångfald. Förvänta dig rikare, funktions-ryggrads-agnostisk och perceptuellt anpassad utvärdering, särskilt eftersom text-till-bild och videogenerering växer ifrån sammanfattningar med enstaka nummer.

Real-World Implementation

Benchmarking GANs som StyleGAN, där team rapporterar FID på datauppsättningar som FFHQ för att jämföra ansiktsgenereringskvalitet.

Spåra träningsframsteg för en diffusionsmodell genom att beräkna FID vid kontrollpunkter för att se när bildkvaliteten slutar förbättras.

Jämför konkurrerande text-till-bild-modeller på COCO-datauppsättningen, där lägre FID citeras som bevis på mer realistiska utdata.

Detekterar lägeskollaps i en generator, eftersom FID:s kovariansterm ökar när modellen producerar för lite bilddiversitet.

Risker & skyddsräcken

Bildrättigheter och samtycke kan bli juridiska risker om härkomst är oklart.

Modellens prestanda kan variera mellan belysning, demografi och miljöer.

Falska positiva resultat kan gå obemärkt förbi om inte konfidensgränser övervakas.

Färdplan för genomförande

1

Definiera acceptanskriterier för precision, återkallelse och felkostnader.

2

Testa med data som matchar verkliga produktionsförhållanden.

3

Lägg till mänsklig granskning för lågt förtroende eller förutsägelser med stor inverkan.

4

Spåra modelldrift och återvalidera efter ändringar av kamera eller datauppsättning.

Fortsätt utforska

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Fréchet Inception Distance quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Starta frågesport

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Signerade avståndsfunktioner

Frequently asked questions

What is Fréchet Inception Distance?

Fréchet Inception Distance (FID) är standardmåttet för att bedöma hur realistisk och varierad en uppsättning genererade bilder är. Den jämför statistiken för verkliga och genererade bilder i ett djupt utrymme - lägre poäng betyder att förfalskningarna ser närmare den äkta varan.

Vad indikerar en lägre FID-poäng?

FID mäter avståndet mellan verkliga och genererade funktionsfördelningar, så ett lägre värde betyder att den genererade uppsättningen mer matchar verklig data i trohet och mångfald.

Vilket förtränat nätverk använder standard FID för att extrahera bildfunktioner?

FID skickar bilder genom ett förtränat Inception-v3-nätverk och använder dess 2048-dimensionella pooling-lager-funktioner för både verkliga och genererade bilder.

Hur sammanfattar FID varje uppsättning bildegenskaper innan de jämförs?

Varje funktionsuppsättning är modellerad som en multivariat Gauss, och FID beräknar Fréchet (2-Wasserstein) avståndet mellan de två Gausserna.

Vilken viktig brist i Inception Score tog FID upp?

Inception Score utvärderade endast genererade bilder isolerat; FID förbättrade det genom att direkt jämföra genererade och verkliga bilddistributioner.

Varför stiger FID när en generator lider av lägeskollaps?

FID använder hela kovariansen av funktioner, så när en modell producerar för lite variation avviker dess spridning från verkliga data, vilket pressar poängen uppåt.