PRZEWODNIK Wizualnej AI

Model dyfuzyjny GLIDE

GLIDE był wczesnym OpenAI modelem dyfuzji tekstu na obraz, który pokazywał podpowiedzi i „wskazówki bez klasyfikatorów”, co mogło pokonać wcześniejsze systemy oparte na GAN.

2 minuty czytaniaOstatnia aktualizacja

Przegląd

To był kluczowy krok na drodze do DALL-E 2.

Głębokie nurkowanie

Opublikowany przez OpenAI pod koniec 2021 r. projekt GLIDE (Guided Language to Image Diffusion for Generation and Editing) pokazał, że modele dyfuzji sterowane tekstem mogą generować fotorealistyczne i wierne obrazy. Największym wkładem projektu było porównanie dwóch sposobów sterowania generowaniem: naprowadzania CLIP i naprowadzania bez klasyfikatorów. Zespół odkrył, że wskazówki wolne od klasyfikatorów pozwoliły uzyskać bardziej realistyczne i lepiej dopasowane obrazy, co od tamtej pory ukształtowało prawie każdy model zamiany tekstu na obraz. GLIDE obsługiwał także malowanie oparte na tekście, umożliwiając użytkownikom edycję części obrazu za pomocą nowego monitu. Wykorzystał model dyfuzyjny o 3,5 miliarda parametrów plus upsampler. OpenAI udostępnił publicznie mniejszą, przefiltrowaną wersję, zatajając pełny model ze względu na obawy dotyczące niewłaściwego użycia, a jego wnioski wprowadzono bezpośrednio do DALL-E 2.

Wgląd techniczny

Podstawową lekcją techniczną GLIDE jest prowadzenie bez klasyfikatorów. Podczas uczenia model czasami widzi prawdziwy tekst podpowiedzi, a czasem pusty, ucząc się zarówno generacji warunkowej, jak i bezwarunkowej. W czasie próbkowania ekstrapoluje się od przewidywania bezwarunkowego w kierunku przewidywania warunkowego, podkreślając, jak silnie wynik podąża za podpowiedzią. Pozwala to uniknąć konieczności stosowania oddzielnego klasyfikatora i zapewnia zauważalnie lepszy realizm i wyrównanie tekstu niż sterowanie za pomocą CLIP, stając się domyślną techniką w późniejszych modelach.

Wpływ strategiczny

Szybkość i skala

Wizualna sztuczna inteligencja może automatyzować zadania inspekcji, wykrywania i znakowania na dużą skalę.

Buduj wybory

Zespoły kreatywne mogą szybciej prototypować koncepcje przy mniejszej liczbie ręcznych poprawek.

Zespół i przepływ pracy

Operacje mogą wykorzystywać sygnały obrazu i wideo, które wcześniej były trudne do przetworzenia.

Przyszłość modelu dyfuzyjnego GLIDE

Sam GLIDE jest w dużej mierze historyczny, zastąpiony przez DALL-E 2, Imagen i Stable Diffusion, ale jego idee są wszędzie obecne. Domyślnym narzędziem pozwalającym na kompromis pomiędzy wiernością i różnorodnością są wskazówki pozbawione klasyfikatorów, a malowanie oparte na tekście jest teraz standardem. Przyszłe systemy stale udoskonalają harmonogramy naprowadzania, redukując artefakty powodowane przez silne naprowadzanie i rozszerzając te same zasady na rozpowszechnianie wideo i 3D, dzięki czemu wpływ GLIDE przetrwa model.

Implementacja w świecie rzeczywistym

Generowanie obrazu ze zdania, takiego jak opisana scena, demonstrując wczesną, szybką i wierną syntezę

Inpainting tekstowy: zamaskowanie fragmentu zdjęcia i wypełnienie go nowym obiektem opisanym słownie

Edycja istniejącego obrazu poprzez dodanie lub wymianę elementów za pomocą monitu

Służenie jako punkt odniesienia w badaniach, które udowodniły, że wytyczne wolne od klasyfikatorów przewyższają wytyczne CLIP dotyczące dostosowania

Zagrożenia i poręcze

Prawa do wizerunku i zgoda mogą stanowić ryzyko prawne, jeśli pochodzenie jest niejasne.

Wydajność modelu może się różnić w zależności od oświetlenia, demografii i środowiska.

Fałszywie pozytywne wyniki mogą pozostać niezauważone, chyba że monitorowane są progi ufności.

Plan wdrożenia

1

Zdefiniuj kryteria akceptacji dotyczące kosztów precyzji, wycofania i błędów.

2

Przetestuj na danych odpowiadających rzeczywistym warunkom produkcyjnym.

3

Dodaj weryfikację manualną, aby prognozy były mało pewne lub miały duży wpływ.

4

Śledź dryf modelu i przeprowadzaj ponowną weryfikację po zmianie kamery lub zbioru danych.

Odkrywaj dalej

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the GLIDE Diffusion Model quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Rozpocznij quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Następny poradnik

Modele dyfuzji utajonej

Często zadawane pytania

Czym jest model dyfuzji GLIDE?

GLIDE był wczesnym OpenAI modelem dyfuzji tekstu na obraz, który pokazywał podpowiedzi i „wskazówki bez klasyfikatorów”, co mogło pokonać wcześniejsze systemy oparte na GAN. Był to kluczowy krok na drodze do DALL-E 2.

Która metoda naprowadzania według GLIDE pozwoliła uzyskać lepsze, szybsze i wierniejsze obrazy?

Projekt GLIDE pokazał, że wytyczne wolne od klasyfikatorów dały bardziej realistyczne i lepiej dopasowane wyniki niż wytyczne CLIP.

Co poza generowaniem podkreśla akronim GLIDE?

GLIDE oznacza Guided Language to Image Diffusion for Generation and Editing, w tym malowanie oparte na tekście.

Jak podczas szkolenia działają wskazówki wolne od klasyfikatorów?

Trenując zarówno na rzeczywistych, jak i pustych podpowiedziach, model uczy się generowania warunkowego i bezwarunkowego, a następnie dokonuje ekstrapolacji między nimi podczas próbkowania.

Do którego późniejszego modelu OpenAI bezpośrednio wpłynęły lekcje GLIDE?

Projekt GLIDE był odskocznią w kierunku DALL-E 2, w którym przyjęto i rozwinięto wnioski ze wskazówek.

Dlaczego OpenAI udostępnił publicznie tylko mniejszą, przefiltrowaną wersję GLIDE?

OpenAI wstrzymał się z pełnym modelem ze względu na obawy dotyczące niewłaściwego użycia i zamiast tego udostępnił filtrowany, mniejszy wariant.