PRZEWODNIK Wizualnej AI

Maskowane obrazowanie generatywne Muse

Muse to model zamiany tekstu na obraz firmy Google, który generuje obrazy poprzez jednoczesne wypełnienie tokenów zamaskowanych obrazów, co znacznie przyspiesza proces rozpowszechniania krok po kroku.

2 minuty czytaniaOstatnia aktualizacja

Przegląd

It matters because it showed you can get high-quality, well-aligned images without the slow iterative denoising that most generators rely on.

Głębokie nurkowanie

Muse działa w dyskretnej przestrzeni symbolicznej obrazu. Wstępnie wyszkolony VQGAN zamienia obraz w siatkę tokenów całkowitych, niczym słownik wizualnych elementów konstrukcyjnych. Podczas szkolenia duża część tych tokenów jest maskowana, a Transformator uczy się je przewidywać, uwarunkowane osadzaniem tekstu z zamrożonego modelu dużego języka (T5-XXL). W czasie generowania Muse zaczyna od całkowicie zamaskowanej siatki i dekoduje w równoległych rundach, przewidując wiele tokenów na krok i ponownie maskując te najmniej pewne. Projekt dwuetapowy najpierw tworzy siatkę tokenów o niskiej rozdzielczości, a następnie model o super rozdzielczości wypełnia siatkę o wyższej rozdzielczości. Ponieważ dziesiątki tokenów są rozpoznawane jednocześnie, modele parametrów 900M i 3B dają obraz o rozdzielczości 256 lub 512 pikseli tylko w kilku przejściach do przodu.

Wgląd techniczny

Podstawową sztuczką jest dekodowanie równoległe z ponownym maskowaniem opartym na zaufaniu, często nazywanym próbkowaniem w stylu MaskGIT. Zamiast przewidywać jeden token na raz (autoregresja) lub odszumiać setki razy (dyfuzja), Muse przewiduje wszystkie zamaskowane tokeny, zatrzymuje te najbardziej pewne i ponownie maskuje resztę na następną rundę. Korzystanie z zamrożonego kodera tekstu T5-XXL zapewnia bezpłatne zrozumienie języka, a działanie na dyskretnych tokenach pozwala modelowi myśleć o obrazach bardziej jak słowa.

Wpływ strategiczny

Szybkość i skala

Wizualna sztuczna inteligencja może automatyzować zadania inspekcji, wykrywania i znakowania na dużą skalę.

Buduj wybory

Zespoły kreatywne mogą szybciej prototypować koncepcje przy mniejszej liczbie ręcznych poprawek.

Zespół i przepływ pracy

Operacje mogą wykorzystywać sygnały obrazu i wideo, które wcześniej były trudne do przetworzenia.

Przyszłość maskowanego obrazowania generatywnego Muse

Zamaskowane dekodowanie równoległe wskazuje na generatory, które są zarówno wysokiej jakości, jak i naprawdę szybkie, co jest niezbędne do interaktywnej edycji i korzystania z urządzenia. Spodziewaj się, że pomysł przewidywania tokenów połączy się z metodami rozpowszechniania i autoregresji wideo oraz umożliwi natychmiastowe malowanie, przemalowywanie i edycję bez maski. W miarę ulepszania dyskretnych tokenizatorów obrazowanie zamaskowane może rozszerzyć się na wideo i 3D, gdzie dekodowanie równoległe może radykalnie obniżyć koszty generowania wielu klatek lub widoków.

Implementacja w świecie rzeczywistym

Szybkie grafiki koncepcyjne i tablice nastrojów, w których artysta potrzebuje wielu odmian obrazu w ciągu kilku sekund, a nie minut.

Malowanie zerowe, takie jak usuwanie obiektu i wypełnianie przez model zamaskowanego obszaru spójnie z otoczeniem.

Outpainting w celu rozszerzenia zdjęcia poza jego oryginalne granice w przypadku banerów lub innych proporcji.

Edycja bez maski, np. zmiana koloru psa lub nieba na zachód słońca, poprzez edycję podpowiedzi tekstowej i ponowne dekodowanie odpowiednich tokenów.

Zagrożenia i poręcze

Prawa do wizerunku i zgoda mogą stanowić ryzyko prawne, jeśli pochodzenie jest niejasne.

Wydajność modelu może się różnić w zależności od oświetlenia, demografii i środowiska.

Fałszywie pozytywne wyniki mogą pozostać niezauważone, chyba że monitorowane są progi ufności.

Plan wdrożenia

1

Zdefiniuj kryteria akceptacji dotyczące kosztów precyzji, wycofania i błędów.

2

Przetestuj na danych odpowiadających rzeczywistym warunkom produkcyjnym.

3

Dodaj weryfikację manualną, aby prognozy były mało pewne lub miały duży wpływ.

4

Śledź dryf modelu i przeprowadzaj ponowną weryfikację po zmianie kamery lub zbioru danych.

Odkrywaj dalej

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Muse Masked Generative Imaging quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Rozpocznij quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Następny poradnik

Zamaskowane autoenkodery

Często zadawane pytania

What is Muse Masked Generative Imaging?

Muse to model zamiany tekstu na obraz firmy Google, który generuje obrazy poprzez jednoczesne wypełnienie tokenów zamaskowanych obrazów, co znacznie przyspiesza proces rozpowszechniania krok po kroku. Ma to znaczenie, ponieważ pokazało, że można uzyskać wysokiej jakości, dobrze wyrównane obrazy bez powolnego, iteracyjnego odszumiania, na którym polega większość generatorów.

Co Muse przewiduje podczas generowania zamiast odszumiania pikseli?

Muse działa w dyskretnej przestrzeni tokenów, przewidując tokeny zamaskowanych obrazów generowane przez tokenizer VQGAN, zamiast bezpośrednio pracować na pikselach.

Dlaczego Muse jest generalnie szybszy niż standardowe modele dyfuzyjne?

Muse wypełnia jednocześnie wiele zamaskowanych tokenów i potrzebuje tylko kilku rund dekodowania, w przeciwieństwie do wielu kolejnych etapów odszumiania w ramach dyfuzji.

Skąd Muse czerpie wiedzę na temat podpowiedzi tekstowych?

Generowanie warunków Muse na podstawie osadzonych tekstów z zamrożonego, wstępnie wytrenowanego modelu języka T5-XXL, zapewniając silne zrozumienie języka.

Jaka jest rola opartego na zaufaniu przemaskowania w Muse?

Po każdej równoległej prognozie Muse zatrzymuje najbardziej pewne żetony i ponownie maskuje te najmniej pewne, aby udoskonalić je w kolejnych rundach.

Jak Muse radzi sobie z tworzeniem obrazów o wyższej rozdzielczości?

Muse najpierw generuje siatkę tokenów o niskiej rozdzielczości, a następnie drugi model o super rozdzielczości tworzy siatkę tokenów o wyższej rozdzielczości.