Vizuální průvodce AI

Škálované generátory GigaGAN

GigaGAN je GAN s miliardou parametrů, který dokazuje, že generativní adversariální sítě se mohou škálovat na generování textu na obrázek, čímž konkurují modelům difúze a přitom generují obrázky stokrát rychleji.

2 minuty čteníNaposledy aktualizováno

Hluboký ponor

GigaGAN, představený společností Adobe a výzkumníky v roce 2023, zpochybnil předpoklad, že GAN se nemohou škálovat jako difúzní modely. Dřívější velké sítě GAN, jako je StyleGAN-XL, se snažily stabilně trénovat na obrovských a různorodých souborech dat. GigaGAN to vyřešil rozšířením generátoru a diskriminátoru, přidáním banky naučených konvolučních filtrů vybraných pro každý vzorek a začleněním křížové pozornosti k vkládání textu. Jeho generátor s 1 miliardou parametrů, trénovaný na miliardách párů obrázek-text, vytváří obrázek o velikosti 512 pixelů za zhruba 0,13 sekundy, mnohem rychleji než iterativní odšumování difúze. Podporuje také interpolaci latentního prostoru, mixování stylů a samostatný upsampler založený na GAN, který dokáže přeměnit 128px vstup na ostrý 4K obraz.

Technický přehled

Klíčovým trikem je modul „výběru jádra s adaptivním vzorkem“: namísto jedné sady filtrů s pevnou konvolucí má generátor sadu filtrů a používá vkládání textu k výpočtu vah, které je smíchají na obrázek. V kombinaci s víceúrovňovým školením a diskriminátorem, který posuzuje záplaty v několika rozlišeních a odpovídá textovým funkcím CLIP, to stabilizuje školení protivníků na úrovni, kde se dříve GAN zhroutily.

Strategický dopad

Rychlost a měřítko

Vizuální AI může automatizovat úkoly inspekce, detekce a označování ve velkém měřítku.

Volby sestavy

Kreativní týmy mohou prototypovat koncepty rychleji s menším počtem ručních revizí.

Tým a pracovní postup

Operace mohou využívat obrazové a video signály, které bylo dříve obtížné zpracovat.

Budoucnost generátorů GigaGAN Scaled

GigaGAN oživil zájem o GAN jako alternativu k difúzi zaměřenou na rychlost, zejména pro úpravy v reálném čase a interaktivní úpravy, kde záleží na generování jedním průchodem. Očekávejte hybridní systémy, které používají generátory ve stylu GAN pro okamžité náhledy a difúzi pro konečné upřesnění, plus GAN upsamplery spárované s difúzními bázemi. Jeho rozpojený latentní prostor jej také činí atraktivním pro ovladatelné editační nástroje, kde hladká interpolace překonává pomalé vzorkování.

Real-World Implementace

Generování obrázku o velikosti 512 pixelů z textové výzvy přibližně za desetinu sekundy pro interaktivní náhledy návrhu

Upscaling 128px fotografie s nízkým rozlišením na ostrý 4K obraz pomocí GAN-založeného super-rozlišení upsampleru

Plynulá interpolace mezi dvěma výzvami v latentním prostoru k oživení přechodů, jako když se šálek kávy mění v konvici

Použití míchání stylů pro zachování rozvržení předmětu při výměně jeho uměleckého stylu nebo barevné palety v nástrojích pro úpravy ve stylu Adobe

Rizika a zábradlí

Obrazová práva a souhlas se mohou stát právním rizikem, pokud je původ nejasný.

Výkon modelu se může lišit podle osvětlení, demografických údajů a prostředí.

Falešně pozitivní mohou zůstat bez povšimnutí, pokud nejsou monitorovány prahové hodnoty spolehlivosti.

Plán implementace

1

Definujte kritéria přijatelnosti pro přesnost, stažení a náklady na chyby.

2

Testujte s daty, která odpovídají reálným výrobním podmínkám.

3

Přidejte lidskou kontrolu pro předpovědi s nízkou spolehlivostí nebo velkým dopadem.

4

Sledujte posun modelu a znovu ověřte po změnách kamery nebo datové sady.

Pokračujte v objevování

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the GigaGAN Scaled Generators quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Spustit kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Další průvodce

Paralelní dekódování tokenů MaskGIT

Často kladené otázky

What is GigaGAN Scaled Generators?

GigaGAN je GAN s miliardou parametrů, který dokazuje, že generativní adversariální sítě se mohou škálovat na generování textu na obrázek, čímž konkurují modelům difúze a přitom generují obrázky stokrát rychleji.

Jaký byl hlavní přínos GigaGAN ke generativnímu modelování?

GigaGAN demonstroval, že GANy, které byly dlouho považovány za těžko škálovatelné, mohou dosáhnout miliardy parametrů a soupeřit s modely difúze v úlohách text-to-image.

Jaká je hlavní rychlostní výhoda GigaGAN oproti difúzním modelům?

GAN se generují v jednom průchodu, takže GigaGAN vytváří obraz o velikosti 512 pixelů za přibližně 0,13 sekundy, mnohem rychleji než iterativní odšumování difuze.

Co dělá „výběr jádra adaptivního na vzorky“ GigaGAN?

Spíše než pevné filtry má GigaGAN sadu filtrů a používá vkládání textu k jejich vážení a míchání na vzorek, čímž zvyšuje kapacitu a stabilitu.

Jak GigaGAN začleňuje textové informace do generování obrázků?

GigaGAN využívá křížovou pozornost na vkládání textu do generátoru a pomocí diskriminátoru zarovnává generované obrázky s textovými funkcemi CLIP.

Jaké další funkce poskytuje GigaGAN nad rámec základní generace?

GigaGAN obsahuje GAN-založený super-rozlišení upsampler, který dokáže přeměnit malý vstup na ostrý 4K obraz.