Obraz 2 i dyfuzja dostosowana do nagród
Imagen 2 to fotorealistyczny, oparty na dyfuzji model zamiany tekstu na obraz firmy Google, udoskonalony poprzez dostrojenie nagrody, dzięki czemu jego wyniki lepiej odpowiadają rzeczywistym oczekiwaniom ludzi.
Przegląd
It matters because it pairs strong image quality and accurate text rendering with alignment techniques borrowed from how chatbots are trained.
Głębokie nurkowanie
Imagen 2 opiera się na oryginalnej recepturze Imagen: duży, zamrożony model językowy koduje zachętę, a kaskada modeli dyfuzyjnych zamienia losowy szum w szczegółowy obraz, zachowując jednocześnie wierność tekstowi. Głównym dodatkiem jest dostrajanie nagród, w którym wyuczony model nagród ocenia wygenerowane obrazy pod kątem takich cech, jak szybkie wyrównanie, estetyka i realizm, a model dyfuzji jest dostrajany w celu uzyskania wyższych wyników. Odzwierciedla to uczenie się przez wzmacnianie na podstawie informacji zwrotnych od ludzi stosowane w modelach językowych. Imagen 2 poprawił fotorealizm, bardziej niezawodną pisownię tekstu na obrazie, wielojęzyczną obsługę podpowiedzi i lepszą obsługę trudnych obiektów, takich jak dłonie i twarze. Dodano także funkcję inpainting i outpainting oraz Google połączył go z narzędziem do znakowania wodnego SynthID, aby w niewidoczny sposób oznaczać obrazy wygenerowane przez sztuczną inteligencję. Obsługuje funkcje Google produktów i środowiska ImageFX.
Wgląd techniczny
Dyfuzja uczy się odwracać proces szumu, stopniowo odszumiając losowe pole w obraz kierowany osadzonym tekstem. Dostrajanie nagród znajduje się na górze: model nagrody, wytrenowany pod kątem ludzkich preferencji, zapewnia sygnał, który popycha model dyfuzji w kierunku wyników, w których ludzie oceniają wyższą ocenę, podobnie jak w przypadku RLHF w przypadku tekstu. W połączeniu ze wskazówkami pozbawionymi klasyfikatorów, które równoważą wierność i różnorodność, pozwala to Imagen 2 bezpośrednio optymalizować pod kątem postrzeganej jakości i dopasowania, a nie tylko dopasowywać rozkład treningów.
Wpływ strategiczny
Szybkość i skala
Wizualna sztuczna inteligencja może automatyzować zadania inspekcji, wykrywania i znakowania na dużą skalę.
Buduj wybory
Zespoły kreatywne mogą szybciej prototypować koncepcje przy mniejszej liczbie ręcznych poprawek.
Zespół i przepływ pracy
Operacje mogą wykorzystywać sygnały obrazu i wideo, które wcześniej były trudne do przetworzenia.
Przyszłość Imagen 2 i dyfuzja dostosowana do nagród
Rozpowszechnianie dostosowane do nagród staje się domyślną ścieżką do kontrolowanego generowania treści o wysokiej wierności, a sygnały dotyczące nagród będą się poszerzać, obejmując bezpieczeństwo, fakty i uczciwość, a także estetykę. Spodziewaj się ściślejszej kontroli edycji, szybszego próbkowania poprzez destylację i standardowego pochodzenia poprzez znak wodny, taki jak SynthID. W miarę jak modele preferencji stają się coraz bardziej szczegółowe i dostosowane do konkretnego użytkownika, generatory obrazów będą w coraz większym stopniu dostosowywać styl i treść do indywidualnych gustów, zachowując jednocześnie identyfikowalność jako stworzone przez sztuczną inteligencję.
Implementacja w świecie rzeczywistym
Tworzenie zdjęć marketingowych i produktów za pomocą dokładnego tekstu w obrazie, takiego jak krótkie slogany lub etykiety.
Inpainting umożliwiający płynne usuwanie lub zastępowanie obiektów na istniejącym zdjęciu.
Przemalowanie w celu rozszerzenia sceny o różne układy, banery lub proporcje.
Generowanie wielojęzycznych zasobów kreatywnych, w których podpowiedzi i renderowany tekst pojawiają się w kilku językach i są oznaczone znakiem wodnym SynthID w celu sprawdzenia pochodzenia.
Zagrożenia i poręcze
Prawa do wizerunku i zgoda mogą stanowić ryzyko prawne, jeśli pochodzenie jest niejasne.
Wydajność modelu może się różnić w zależności od oświetlenia, demografii i środowiska.
Fałszywie pozytywne wyniki mogą pozostać niezauważone, chyba że monitorowane są progi ufności.
Plan wdrożenia
Zdefiniuj kryteria akceptacji dotyczące kosztów precyzji, wycofania i błędów.
Przetestuj na danych odpowiadających rzeczywistym warunkom produkcyjnym.
Dodaj weryfikację manualną, aby prognozy były mało pewne lub miały duży wpływ.
Śledź dryf modelu i przeprowadzaj ponowną weryfikację po zmianie kamery lub zbioru danych.
Odkrywaj dalej
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Imagen 2 and Reward-Tuned Diffusion quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Następny poradnik
Stabilna dyfuzja wideo
Często zadawane pytania
What is Imagen 2 and Reward-Tuned Diffusion?
Imagen 2 to fotorealistyczny, oparty na dyfuzji model zamiany tekstu na obraz firmy Google, udoskonalony poprzez dostrojenie nagrody, dzięki czemu jego wyniki lepiej odpowiadają rzeczywistym oczekiwaniom ludzi. Ma to znaczenie, ponieważ łączy wysoką jakość obrazu i dokładne renderowanie tekstu z technikami wyrównywania zapożyczonymi ze szkolenia chatbotów.
Z jakiej podstawowej techniki generatywnej korzysta Imagen 2?
Imagen 2 to model dyfuzyjny: uczy się odwracać proces szumu, zamieniając przypadkowy szum w szczegółowy obraz kierowany tekstem.
Co dostrajanie nagród dodaje do Imagen 2?
Dostrajanie nagród dostraja model za pomocą modelu nagrody wytrenowanego na ludzkich preferencjach, kierując go w stronę lepiej ocenianych i lepiej dopasowanych obrazów.
Jaką technikę z treningu modelu językowego przypomina dostrajanie nagród w Imagen 2?
Dostrajanie nagród jest koncepcyjnie podobne do RLHF: model nagrody oparty na preferencjach prowadzi dostrajania w kierunku przychylności ludzi.
Jak Imagen 2 rozumie zachętę tekstową?
Imagen 2 jest zgodny z przepisem Imagen polegającym na użyciu dużego, zamrożonego modelu języka do zakodowania podpowiedzi w osadzeniu tekstu sformatowanego.
Do czego służy SynthID w obrazach Imagen 2?
SynthID dodaje niewidoczny znak wodny, dzięki czemu obrazy wygenerowane przez sztuczną inteligencję można zidentyfikować pod kątem pochodzenia, nawet po kilku edycjach.