Visual AI GUIDE

Klassificeringsfri vägledning

Klassificeringsfri vägledning är tekniken som gör att diffusionsmodeller faktiskt följer din uppmaning och byter ut lite mångfald för mycket starkare efterlevnad.

2 min readSenast uppdaterad

Översikt

It is the single dial behind the 'guidance scale' slider in nearly every image generator.

Djupdykning

Tidig guidad diffusion behövde en separat klassificerare för att driva prover mot en önskad klass, vilket var bräckligt och krävde extra träning. Klassificeringsfri vägledning, föreslog av Jonathan Ho och Tim Salimans 2022, tar bort det beroendet. Under träning tappar modellen slumpmässigt konditioneringen (textprompten) någon procent av tiden, så den lär sig att producera både villkorade och ovillkorliga förutsägelser med ett enda nätverk. Vid samplingstillfället kör du modellen två gånger per steg, en gång med prompten och en gång utan, och extrapolerar sedan bort från den ovillkorliga förutsägelsen mot den villkorliga. Mängden extrapolering är vägledningsskalan: högre värden tvingar stramare snabb vidhäftning och starkare mättnad, medan lägre värden ger mer variation men lösare matchning.

Teknisk insikt

Matematiskt är den guidade brusförutsägelsen den ovillkorliga förutsägelsen plus vägledningsskalan gånger skillnaden mellan villkorade och ovillkorliga förutsägelser. En skala på 1 betyder ingen vägledning; typiska värden är 5 till 9. Att trycka på skalan mycket högt förstärker promptfunktioner men orsakar övermättade färger, hårda kontraster och artefakter, eftersom modellen extrapolerar långt utanför sin inlärda distribution. Det kostar ungefär två framåtpassningar per denoise-steg.

Strategisk inverkan

Speed and scale

Visual AI kan automatisera inspektion, upptäckt och taggningsuppgifter i stor skala.

Build choices

Kreativa team kan prototypa koncept snabbare med färre manuella revisioner.

Team and workflow

Operationer kan använda bild- och videosignaler som tidigare var svåra att bearbeta.

Framtiden för klassificerarefri vägledning

Forskare förfinar vägledning för att bibehålla omedelbar efterlevnad utan övermättnad, genom dynamisk tröskelvärde, vägledningsscheman som ändrar styrka över steg och omskalningstrick. Destillerade modeller bakar nu in vägledning i ett enda pass för att halvera beräkningen, och nyare formuleringar utforskar störd uppmärksamhet och autoguidning som inte behöver någon villkorslös gren alls, i syfte att få skarpa, trogna bilder till lägre kostnad.

Real-World Implementation

Justera "CFG-skalan"-reglaget i Stable Diffusion eller Midjourney för att balansera snabb noggrannhet mot kreativitet

Öka vägledning för att tvinga en generator att inkludera ett specifikt, svårtillgängligt objekt som beskrivs i prompten

Sänkning av styrningen för att få mer varierande, mindre övermättade utgångar när man utforskar många designalternativ

Justera vägledningsscheman i produktionspipelines för att minska färgförbränningsartefakter på högdetaljerade renderingar

Risker & skyddsräcken

Bildrättigheter och samtycke kan bli juridiska risker om härkomst är oklart.

Modellens prestanda kan variera mellan belysning, demografi och miljöer.

Falska positiva resultat kan gå obemärkt förbi om inte konfidensgränser övervakas.

Färdplan för genomförande

1

Definiera acceptanskriterier för precision, återkallelse och felkostnader.

2

Testa med data som matchar verkliga produktionsförhållanden.

3

Lägg till mänsklig granskning för lågt förtroende eller förutsägelser med stor inverkan.

4

Spåra modelldrift och återvalidera efter ändringar av kamera eller datauppsättning.

Fortsätt utforska

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Classifier-Free Guidance quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Starta frågesport

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Naiva Bayes klassificerare

Frequently asked questions

What is Classifier-Free Guidance?

Klassificeringsfri vägledning är tekniken som gör att diffusionsmodeller faktiskt följer din uppmaning och byter ut lite mångfald för mycket starkare efterlevnad. Det är den enda ratten bakom reglaget för "vägledningsskala" i nästan varje bildgenerator.

Vad är huvudsyftet med klassificeringsfri vägledning?

Klassificeringsfri vägledning ökar snabb efterlevnad genom att extrapolera från det ovillkorliga till den villkorliga förutsägelsen.

Hur lär sig en modell att göra ovillkorliga förutsägelser för klassificeringsfri vägledning?

Under träningen avbryts prompten slumpmässigt en del av tiden, så ett nätverk lär sig både villkorligt och ovillkorligt beteende.

Vad gör en ökning av vägledningsskalan generellt?

Högre vägledning tvingar fram snävare vidhäftning och starkare funktioner, men om du skjuter den för långt orsakar det övermättade, hårda, artefaktbenägna bilder.

Ungefär hur många framåtpassningar per denoising-steg kräver standardklassificerfri vägledning?

Modellen körs en gång med prompten och en gång utan, sedan kombineras förutsägelserna, vilket kostar cirka två pass per steg.

Vilken fördel har klassificerarefri vägledning framför klassificerarevägledning?

Genom att använda ett enda nätverk för båda förutsägelserna undviker man den bräckliga, extra klassificeraren som äldre guidad diffusion krävde.