Muse Masked Generative Imaging
Muse е модел текст-към-изображение от Google, който генерира картини чрез попълване на маскирани символи на изображение наведнъж, което го прави много по-бързо от дифузията стъпка по стъпка.
Преглед
It matters because it showed you can get high-quality, well-aligned images without the slow iterative denoising that most generators rely on.
Дълбоко гмуркане
Muse работи в дискретното символично пространство на изображение. Предварително обучен VQGAN превръща картина в мрежа от цели числа, като речник от визуални градивни елементи. По време на обучението голяма част от тези токени се маскират и трансформаторът се научава да ги предсказва обратно, в зависимост от вграждането на текст от замразен голям езиков модел (T5-XXL). По време на генериране Muse започва от изцяло маскирана решетка и декодира в паралелни кръгове, предвиждайки много токени на стъпка и премаскирайки най-малко уверените. Двустепенният дизайн първо създава решетка с токени с ниска разделителна способност, след което модел със супер разделителна способност запълва мрежа с по-висока разделителна способност. Тъй като десетки токени се разрешават едновременно, моделите с параметри 900M и 3B произвеждат изображение от 256 или 512 пиксела само с няколко преминавания напред.
Техническа информация
Основният трик е паралелно декодиране с римаскиране, базирано на доверие, често наричано семплиране в стил MaskGIT. Вместо да предвижда токен по един (авторегресия) или да премахва шума стотици пъти (дифузия), Muse прогнозира всички маскирани токени, запазва най-уверените и повторно маскира останалите за следващия кръг. Използването на замразен текстов енкодер T5-XXL дава безплатно разбиране на езика, а работата с отделни токени позволява на модела да разсъждава за изображения, които приличат повече на думи.
Стратегическо въздействие
Speed and scale
Visual AI може да автоматизира задачи за проверка, откриване и маркиране в мащаб.
Build choices
Творческите екипи могат да създават прототипи на концепции по-бързо с по-малко ръчни ревизии.
Team and workflow
Операциите могат да използват изображения и видео сигнали, които преди са били трудни за обработка.
Бъдещето на Muse Masked Generative Imaging
Маскираното паралелно декодиране сочи към генератори, които са едновременно висококачествени и наистина бързи, което е от съществено значение за интерактивно редактиране и използване на устройството. Очаквайте идеята за предсказване на токени да се слее с дифузионни и авторегресивни видео методи и да задвижи незабавно рисуване, рисуване и редактиране без маска. Тъй като дискретните токенизатори се подобряват, маскираното изображение може да се разшири чисто във видео и 3D, където паралелното декодиране може драстично да намали разходите за генериране на много кадри или изгледи.
Внедряване в реалния свят
Бързо концептуално изкуство и дъски за настроение, където художникът се нуждае от много вариации на изображението за секунди, а не за минути.
Zero-shot inpainting, като например премахване на обект и моделът да запълни маскираната област последователно с околната среда.
Прерисуване за разширяване на снимка отвъд оригиналните й граници за банери или различни пропорции.
Редактиране без маска, като промяна на цвета на куче или небе до залез чрез редактиране на текстовата подкана и повторно декодиране на засегнатите токени.
Рискове и предпазни огради
Правата върху изображението и съгласието могат да се превърнат в правни рискове, ако произходът е неясен.
Производителността на модела може да варира в зависимост от осветлението, демографските данни и средата.
Фалшивите положителни резултати могат да останат незабелязани, освен ако не се наблюдават праговете на достоверност.
Пътна карта за изпълнение
Определете критерии за приемане за прецизност, извикване и разходи за грешки.
Тествайте с данни, които съответстват на реалните производствени условия.
Добавете преглед от човек за прогнози с ниска степен на сигурност или с голямо въздействие.
Проследявайте дрейфа на модела и проверявайте отново след промени в камерата или набора от данни.
Продължете да изследвате
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Muse Masked Generative Imaging quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Маскирани автоенкодери
Frequently asked questions
What is Muse Masked Generative Imaging?
Muse е модел текст-към-изображение от Google, който генерира картини чрез попълване на маскирани символи на изображение наведнъж, което го прави много по-бързо от дифузията стъпка по стъпка. Има значение, защото показа, че можете да получите висококачествени, добре подравнени изображения без бавното итеративно премахване на шума, на което повечето генератори разчитат.
Какво прогнозира Muse по време на генериране вместо премахване на шума на пикселите?
Muse работи в дискретно пространство на токени, предсказвайки токени за маскирани изображения, произведени от VQGAN токенизатор, вместо да работи директно върху пиксели.
Защо Muse като цяло е по-бърз от стандартните дифузионни модели?
Muse попълва много маскирани токени едновременно и се нуждае само от няколко кръга на декодиране, за разлика от многото последователни стъпки за премахване на шума на дифузията.
Откъде Muse получава своето разбиране на текстовата подкана?
Muse обуславя генерирането на текстови вграждания от замразен предварително обучен езиков модел T5-XXL, като му осигурява силно разбиране на езика.
Каква е ролята на базираното на доверие римаскиране в Muse?
След всяка паралелна прогноза Muse запазва най-сигурните токени и премаскира най-несигурните, за да ги прецизира в последователни кръгове.
Как Muse се справя с производството на изображения с по-висока разделителна способност?
Muse първо генерира токен мрежа с ниска разделителна способност, след това вторият модел със супер разделителна способност създава токен мрежа с по-висока разделителна способност.