Parallel Token декодиране на MaskGIT
MaskGIT генерира изображения, като предсказва много токени наведнъж и попълва първо най-сигурните, заменяйки бавното генериране отляво надясно с шепа бързи паралелни стъпки.
Дълбоко гмуркане
MaskGIT (Maskid Generative Image Transformer), от Google през 2022 г., преосмисля как декодират моделите на изображения, базирани на токени. По-ранните трансформатори като VQGAN генерираха токени авторегресивно, един по един в растерен ред, което е бавно и неестествено за 2D изображения. MaskGIT вместо това се обучава с маскирана цел за моделиране като BERT: произволни подмножества от токени на изображения са скрити и моделът се научава да ги предсказва всички едновременно, използвайки двупосочно внимание. По време на генериране той започва от напълно маскирана решетка и декодира с фиксиран брой итерации (често от 8 до 12). На всяка стъпка той предвижда всеки маскиран токен, запазва прогнозите с най-висока степен на сигурност и повторно маскира останалите за следващия кръг. Това създава висококачествени изображения в приблизително един порядък по-малко стъпки от авторегресивното декодиране.
Техническа информация
Решаващият компонент е базираният на доверие график за маскиране. Косинусният график решава колко жетони да се разкрият при всяка итерация, започвайки бавно и ускорявайки. Тъй като вниманието е двупосочно, всеки токен вижда цялото частично изображение, така че извършването на най-уверените прогнози първо позволява на по-късните стъпки да обуславят солиден контекст, подобно на решаването на лесните части на пъзел преди двусмислените.
Стратегическо въздействие
Speed and scale
Visual AI може да автоматизира задачи за проверка, откриване и маркиране в мащаб.
Build choices
Творческите екипи могат да създават прототипи на концепции по-бързо с по-малко ръчни ревизии.
Team and workflow
Операциите могат да използват изображения и видео сигнали, които преди са били трудни за обработка.
Бъдещето на паралелното декодиране на токени на MaskGIT
Паралелното итеративно декодиране на MaskGIT вдъхнови вълна от неавторегресивни генератори, включително MUSE за текст към изображение и маскирани подходи за видео. Моделът, предсказващ токени паралелно и прецизиращ през няколко стъпки, се намира между еднократните GAN и многоетапната дифузия, предлагайки регулируем компромис между качество и скорост. Очаквайте маскираното декодиране на токени да продължи да се появява в бързи мултимодални генератори и системи за редактиране, където рисуването и условните запълвания са естествени.
Внедряване в реалния свят
Генериране на пълно изображение в около 8 до 12 паралелни стъпки вместо стотици авторегресивни прогнози на токени
Рисуване на маскиран регион на снимка чрез повторно предсказване само на скритите токени със заобикалящия контекст
Класово условен синтез на изображения в ImageNet при качество, конкурентно с много по-бавни модели
Служи като основа за декодиране на системи от текст към изображение като MUSE на Google, които се нуждаят от бързо генериране
Рискове и предпазни огради
Правата върху изображението и съгласието могат да се превърнат в правни рискове, ако произходът е неясен.
Производителността на модела може да варира в зависимост от осветлението, демографските данни и средата.
Фалшивите положителни резултати могат да останат незабелязани, освен ако не се наблюдават праговете на достоверност.
Пътна карта за изпълнение
Определете критерии за приемане за прецизност, извикване и разходи за грешки.
Тествайте с данни, които съответстват на реалните производствени условия.
Добавете преглед от човек за прогнози с ниска степен на сигурност или с голямо въздействие.
Проследявайте дрейфа на модела и проверявайте отново след промени в камерата или набора от данни.
Продължете да изследвате
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the MaskGIT Parallel Token Decoding quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Паралелно декодиране на скелет на мисълта
Frequently asked questions
What is MaskGIT Parallel Token Decoding?
MaskGIT генерира изображения, като предсказва много токени наведнъж и попълва първо най-сигурните, заменяйки бавното генериране отляво надясно с шепа бързи паралелни стъпки.
Как MaskGIT декодира токените на изображението по различен начин от трансформатора на VQGAN?
MaskGIT предвижда всички маскирани токени едновременно с двупосочно внимание, за разлика от бавното авторегресивно декодиране отляво надясно на VQGAN.
Каква цел на обучението заимства MaskGIT от езиковите модели?
MaskGIT скрива произволни подгрупи от токени и се научава да ги предсказва, маскирана цел за моделиране, подобна на BERT.
По време на генерирането кои токени MaskGIT ангажира при всяка итерация?
Всяка стъпка запазва най-уверените прогнози и премаскира останалите, така че по-късните стъпки са зависими от надежден контекст.
Приблизително колко итерации обикновено се нуждае от MaskGIT, за да генерира изображение?
MaskGIT декодира в малък фиксиран брой стъпки, често от 8 до 12, много по-малко от авторегресивните или дифузионните подходи.
Какъв график контролира колко токени MaskGIT разкрива на всяка стъпка?
Косинусният график разкрива няколко токена рано и повече по-късно, балансирайки качеството и скоростта в итерациите.