Авторегресивно генериране на изображения
Авторегресивното генериране на изображения изгражда картини една част по една, предсказвайки всеки токен от всичко, генерирано преди него.
Преглед
It matters because the same next-token machinery powering language models can produce coherent, controllable images.
Дълбоко гмуркане
Авторегресивното генериране на изображения третира картина като последователност и я предсказва елемент по елемент, където всеки нов елемент е обусловен от всички предишни. Ранни разработки като PixelRNN и PixelCNN предвиждаха изображения един необработен пиксел наведнъж, сканирайки ред по ред, което беше бавно, но теоретично чисто. Съвременните системи вместо това първо компресират изображение в мрежа от отделни токени, използвайки енкодер в стил VQ-VAE, след което Transformer предвижда тези токени отляво надясно. DALL-E 1 на OpenAI и Parti на Google последваха тази рецепта, генерирайки токени за изображения, обусловени от текстова подкана, преди да ги декодират обратно в пиксели. Голямото предимство е точното моделиране на вероятността и унифицирана архитектура, споделена с езика. Цената е последователно, бавно вземане на проби.
Техническа информация
Моделът факторизира общата вероятност на всички токени в продукт на условни условия: p(x) = продукт на p(x_i дадено x_1...x_{i-1}). Трансформатор с каузално (маскирано) внимание налага всяка позиция да вижда само по-ранни токени. По време на обучението той предсказва всеки токен паралелно, като използва форсирането на учителя, но при заключение трябва да взема проби един токен наведнъж, подавайки всеки обратно. Научената кодова книга картографира токените обратно към пачове на изображения, които декодерът преобразува в крайни пиксели.
Стратегическо въздействие
Speed and scale
Visual AI може да автоматизира задачи за проверка, откриване и маркиране в мащаб.
Build choices
Творческите екипи могат да създават прототипи на концепции по-бързо с по-малко ръчни ревизии.
Team and workflow
Операциите могат да използват изображения и видео сигнали, които преди са били трудни за обработка.
Бъдещето на авторегресивното генериране на изображения
Скоростта е централното бойно поле. Техники като паралелно декодиране и декодиране с маскирани токени (MaskGIT, Muse) генерират много токени наведнъж, а спекулативното декодиране, заимствано от езикови модели, се адаптира към изображения. Изследователите също обединяват текстови и графични токени в един авторегресивен гръбнак, така че един модел да може да чете и рисува, както се вижда в мултимодални системи. Очаквайте идеите за авторегресия и дифузия да продължат да се смесват, като хибридните модели улавят контролируемостта на токените и качеството на дифузията.
Внедряване в реалния свят
DALL-E 1 генерира изображения чрез авторегресивно прогнозиране на решетка от дискретни токени на изображение от текстов надпис.
Parti на Google мащабира авторегресивен трансформатор на текст към изображение до 20 милиарда параметъра за детайлни, бързи и верни сцени.
PixelCNN и PixelRNN демонстрираха необработено генериране пиксел по пиксел и все още се използват като базови линии за обучение за модели, базирани на вероятности.
MaskGIT и Muse използват паралелно декодиране на маскиран токен, за да ускорят базирания на токен синтез на изображения, като същевременно поддържат обучение в авторегресивен стил.
Рискове и предпазни огради
Правата върху изображението и съгласието могат да се превърнат в правни рискове, ако произходът е неясен.
Производителността на модела може да варира в зависимост от осветлението, демографските данни и средата.
Фалшивите положителни резултати могат да останат незабелязани, освен ако не се наблюдават праговете на достоверност.
Пътна карта за изпълнение
Определете критерии за приемане за прецизност, извикване и разходи за грешки.
Тествайте с данни, които съответстват на реалните производствени условия.
Добавете преглед от човек за прогнози с ниска степен на сигурност или с голямо въздействие.
Проследявайте дрейфа на модела и проверявайте отново след промени в камерата или набора от данни.
Продължете да изследвате
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Autoregressive Image Generation quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
AI Генериране на изображения
Frequently asked questions
What is Autoregressive Image Generation?
Авторегресивното генериране на изображения изгражда картини една част по една, предсказвайки всеки токен от всичко, генерирано преди него. Има значение, защото една и съща машина за следващ токен, захранваща езиковите модели, може да произвежда съгласувани, контролируеми изображения.
Какво означава „авторегресия“ в контекста на генерирането на изображения?
Авторегресивните модели факторизират изображението като последователност, предвиждайки всеки токен или пиксел въз основа на всички елементи, генерирани преди него.
Как съвременните авторегресивни модели на изображения като DALL-E 1 обикновено представят изображение, преди да го предскажат?
Съвременните системи компресират изображението в отделни токени (често чрез енкодер в стил VQ-VAE), след което предвиждат тази последователност от токени с трансформатор.
Кои ранни модели генерираха изображения един необработен пиксел наведнъж?
PixelRNN и PixelCNN бяха пионери в авторегресивните модели, които сканират и прогнозират изображения пиксел по пиксел.
Какъв механизъм гарантира, че Transformer обръща внимание само на по-ранни токени по време на авторегресивно генериране?
Причинно-следственото маскиране блокира всяка позиция от обръщане към бъдещи токени, налагайки факторизацията отляво надясно.
Какъв е основният практически недостатък на авторегресивното вземане на проби от изображения?
Тъй като всеки токен зависи от предишните, изводът трябва да изпълнява токен по токен, което прави генерирането сравнително бавно.