PRZEWODNIK Wizualnej AI

Generacja uziemiona GLIGEN

GLIGEN (Grounded-Language-to-Image Generation) pozwala dokładnie kontrolować, gdzie obiekty pojawiają się na wygenerowanym obrazie, umieszczając ramki ograniczające model i etykiety obok podpowiedzi tekstowych.

2 minuty czytaniaOstatnia aktualizacja

Przegląd

It turns vague text-to-image into precise, layout-controllable synthesis.

Głębokie nurkowanie

Standardowe modele zamiany tekstu na obraz mają problemy z kontrolą przestrzenną: poproś o „kota po lewej stronie psa”, a często pomylisz się z jego umiejscowieniem. GLIGEN, wprowadzony w 2023 r., rozwiązuje ten problem, dodając uziemiające dane wejściowe, takie jak ramki ograniczające sparowane z elementami tekstowymi lub obrazowymi, punktami kluczowymi lub obrazami referencyjnymi. Co najważniejsze, zamraża ciężary oryginalnego, wstępnie wytrenowanego modelu dyfuzyjnego i wprowadza nowe, dające się trenować, bramkowane warstwy samouwagi, które pochłaniają tokeny uziemienia. Oznacza to, że opiera się na modelu takim jak Stable Diffusion, nie niszcząc wyuczonej wiedzy, a bramkowanie rozpoczyna się w pobliżu zera, więc zachowanie modelu podstawowego zostaje zachowane na początku szkolenia. Rezultatem jest generowanie ugruntowane w otwartym świecie: możesz umieścić dowolne opisane obiekty w określonych lokalizacjach, co uogólnia koncepcje i układy nie widziane podczas szkolenia ugruntowanego.

Wgląd techniczny

GLIGEN reprezentuje każdą jednostkę uziemiającą jako token łączący osadzony w niej tekst lub obraz z informacjami przestrzennymi, takimi jak cztery współrzędne ramki ograniczającej zakodowanej za pomocą funkcji Fouriera. Te tokeny uziemiające wchodzą do zamrożonej dyfuzyjnej sieci U-Net poprzez nowo wstawione, bramkowane warstwy samouwagi, umieszczone pomiędzy istniejącymi blokami samouważności i wzajemnej uwagi. Bramka, której można się uczyć, zainicjowana na zero, kontroluje wpływ uziemienia na generację, więc dodanie kontroli łagodnie się pogarsza, a trening pozostaje stabilny.

Wpływ strategiczny

Szybkość i skala

Wizualna sztuczna inteligencja może automatyzować zadania inspekcji, wykrywania i znakowania na dużą skalę.

Buduj wybory

Zespoły kreatywne mogą szybciej prototypować koncepcje przy mniejszej liczbie ręcznych poprawek.

Zespół i przepływ pracy

Operacje mogą wykorzystywać sygnały obrazu i wideo, które wcześniej były trudne do przetworzenia.

Przyszłość generacji naziemnej GLIGEN

Uziemione i sterowane układem generowanie staje się standardem w narzędziach produkcyjnych. Można się spodziewać, że warunkowanie przestrzenne w stylu GLIGEN połączy się z innymi metodami kontroli, takimi jak ControlNet i podpowiedzi regionalne, a także rozszerzy się na wideo i 3D, gdzie rozmieszczenie obiektów w czasie i przestrzeni ma jeszcze większe znaczenie. Ponieważ modele przyjmują interfejsy zgodne z instrukcjami, sterowanie układem metodą „przeciągnij i upuść” oraz wykresy scen w określonym języku umożliwią dostęp do precyzyjnej kompozycji bez konieczności stosowania szybkich sztuczek inżynieryjnych.

Implementacja w świecie rzeczywistym

Umieszczenie logo lub produktu w dokładnym obszarze wygenerowanej reklamy za pomocą ramki ograniczającej

Komponowanie złożonych scen poprzez określenie, gdzie powinna znajdować się każda postać lub obiekt przed renderowaniem

Generowanie danych szkoleniowych do wykrywania obiektów ze znanymi lokalizacjami skrzynek prawdy naziemnej

Malowanie opisywanego obiektu na narysowany przez użytkownika obszar istniejącego zdjęcia

Zagrożenia i poręcze

Prawa do wizerunku i zgoda mogą stanowić ryzyko prawne, jeśli pochodzenie jest niejasne.

Wydajność modelu może się różnić w zależności od oświetlenia, demografii i środowiska.

Fałszywie pozytywne wyniki mogą pozostać niezauważone, chyba że monitorowane są progi ufności.

Plan wdrożenia

1

Zdefiniuj kryteria akceptacji dotyczące kosztów precyzji, wycofania i błędów.

2

Przetestuj na danych odpowiadających rzeczywistym warunkom produkcyjnym.

3

Dodaj weryfikację manualną, aby prognozy były mało pewne lub miały duży wpływ.

4

Śledź dryf modelu i przeprowadzaj ponowną weryfikację po zmianie kamery lub zbioru danych.

Odkrywaj dalej

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the GLIGEN Grounded Generation quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Rozpocznij quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Następny poradnik

Generowanie tekstu na 3D

Często zadawane pytania

What is GLIGEN Grounded Generation?

GLIGEN (Grounded-Language-to-Image Generation) pozwala dokładnie kontrolować, gdzie obiekty pojawiają się na wygenerowanym obrazie, umieszczając ramki ograniczające model i etykiety obok podpowiedzi tekstowych. Zamienia niejasny tekst w obraz w precyzyjną syntezę kontrolowaną układem.

Jaki problem przede wszystkim rozwiązuje GLIGEN?

GLIGEN dodaje wejścia uziemiające, takie jak obwiednie, dzięki czemu możesz dokładnie kontrolować, gdzie umieszczane są obiekty, a podpowiedzi w postaci zwykłego tekstu są słabo obsługiwane.

W jaki sposób GLIGEN zachowuje wiedzę o wytrenowanym modelu dyfuzji?

GLIGEN zamraża model podstawowy i wprowadza nowe warstwy samouważności, dzięki czemu pierwotna zdobyta wiedza pozostaje nienaruszona.

Jakie jest typowe wejście uziemiające akceptowane przez GLIGEN?

GLIGEN obsługuje uziemianie poprzez ramki ograniczające z elementami tekstowymi/obrazami, punktami kluczowymi i obrazami referencyjnymi.

Dlaczego bramka w nowych warstwach uwagi GLIGEN jest inicjowana na zero?

Bramka inicjowana zerem oznacza, że ​​uziemienie początkowo nie działa, zachowując oryginalny model i utrzymując stabilność treningu w miarę wzrostu kontroli.

Co oznacza w GLIGEN generacja uziemiona „otwartego świata”?

GLIGEN dokonuje uogólnień wykraczających poza swój uziemiający zestaw treningowy, umieszczając nowe opisane obiekty w określonych lokalizacjach.