РЪКОВОДСТВО за визуален AI

Parallel Token декодиране на MaskGIT

MaskGIT генерира изображения, като предсказва много токени наведнъж и попълва първо най-сигурните, заменяйки бавното генериране отляво надясно с шепа бързи паралелни стъпки.

2 min readПоследна актуализация

Дълбоко гмуркане

MaskGIT (Maskid Generative Image Transformer), от Google през 2022 г., преосмисля как декодират моделите на изображения, базирани на токени. По-ранните трансформатори като VQGAN генерираха токени авторегресивно, един по един в растерен ред, което е бавно и неестествено за 2D изображения. MaskGIT вместо това се обучава с маскирана цел за моделиране като BERT: произволни подмножества от токени на изображения са скрити и моделът се научава да ги предсказва всички едновременно, използвайки двупосочно внимание. По време на генериране той започва от напълно маскирана решетка и декодира с фиксиран брой итерации (често от 8 до 12). На всяка стъпка той предвижда всеки маскиран токен, запазва прогнозите с най-висока степен на сигурност и повторно маскира останалите за следващия кръг. Това създава висококачествени изображения в приблизително един порядък по-малко стъпки от авторегресивното декодиране.

Техническа информация

Решаващият компонент е базираният на доверие график за маскиране. Косинусният график решава колко жетони да се разкрият при всяка итерация, започвайки бавно и ускорявайки. Тъй като вниманието е двупосочно, всеки токен вижда цялото частично изображение, така че извършването на най-уверените прогнози първо позволява на по-късните стъпки да обуславят солиден контекст, подобно на решаването на лесните части на пъзел преди двусмислените.

Стратегическо въздействие

Speed and scale

Visual AI може да автоматизира задачи за проверка, откриване и маркиране в мащаб.

Build choices

Творческите екипи могат да създават прототипи на концепции по-бързо с по-малко ръчни ревизии.

Team and workflow

Операциите могат да използват изображения и видео сигнали, които преди са били трудни за обработка.

Бъдещето на паралелното декодиране на токени на MaskGIT

Паралелното итеративно декодиране на MaskGIT вдъхнови вълна от неавторегресивни генератори, включително MUSE за текст към изображение и маскирани подходи за видео. Моделът, предсказващ токени паралелно и прецизиращ през няколко стъпки, се намира между еднократните GAN и многоетапната дифузия, предлагайки регулируем компромис между качество и скорост. Очаквайте маскираното декодиране на токени да продължи да се появява в бързи мултимодални генератори и системи за редактиране, където рисуването и условните запълвания са естествени.

Внедряване в реалния свят

Генериране на пълно изображение в около 8 до 12 паралелни стъпки вместо стотици авторегресивни прогнози на токени

Рисуване на маскиран регион на снимка чрез повторно предсказване само на скритите токени със заобикалящия контекст

Класово условен синтез на изображения в ImageNet при качество, конкурентно с много по-бавни модели

Служи като основа за декодиране на системи от текст към изображение като MUSE на Google, които се нуждаят от бързо генериране

Рискове и предпазни огради

Правата върху изображението и съгласието могат да се превърнат в правни рискове, ако произходът е неясен.

Производителността на модела може да варира в зависимост от осветлението, демографските данни и средата.

Фалшивите положителни резултати могат да останат незабелязани, освен ако не се наблюдават праговете на достоверност.

Пътна карта за изпълнение

1

Определете критерии за приемане за прецизност, извикване и разходи за грешки.

2

Тествайте с данни, които съответстват на реалните производствени условия.

3

Добавете преглед от човек за прогнози с ниска степен на сигурност или с голямо въздействие.

4

Проследявайте дрейфа на модела и проверявайте отново след промени в камерата или набора от данни.

Продължете да изследвате

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the MaskGIT Parallel Token Decoding quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Паралелно декодиране на скелет на мисълта

Frequently asked questions

What is MaskGIT Parallel Token Decoding?

MaskGIT генерира изображения, като предсказва много токени наведнъж и попълва първо най-сигурните, заменяйки бавното генериране отляво надясно с шепа бързи паралелни стъпки.

Как MaskGIT декодира токените на изображението по различен начин от трансформатора на VQGAN?

MaskGIT предвижда всички маскирани токени едновременно с двупосочно внимание, за разлика от бавното авторегресивно декодиране отляво надясно на VQGAN.

Каква цел на обучението заимства MaskGIT от езиковите модели?

MaskGIT скрива произволни подгрупи от токени и се научава да ги предсказва, маскирана цел за моделиране, подобна на BERT.

По време на генерирането кои токени MaskGIT ангажира при всяка итерация?

Всяка стъпка запазва най-уверените прогнози и премаскира останалите, така че по-късните стъпки са зависими от надежден контекст.

Приблизително колко итерации обикновено се нуждае от MaskGIT, за да генерира изображение?

MaskGIT декодира в малък фиксиран брой стъпки, често от 8 до 12, много по-малко от авторегресивните или дифузионните подходи.

Какъв график контролира колко токени MaskGIT разкрива на всяка стъпка?

Косинусният график разкрива няколко токена рано и повече по-късно, балансирайки качеството и скоростта в итерациите.