Parti Pathways Авторегресивно изображение
Parti (Pathways Autoregressive Text-to-Image) генерира картини по начина, по който езиковите модели пишат изречения: един символ на изображение наведнъж, предвиждайки следващия от всичко, което е било преди.
Преглед
It matters because it showed that simply scaling a sequence model can produce strikingly detailed, prompt-faithful images.
Дълбоко гмуркане
Parti третира генерирането на изображения като проблем за превод от последователност към последователност, подобно на машинния превод. ViT-VQGAN токенизатор първо кодира изображение в последователност от отделни токени, извлечени от научена кодова книга. Кодерът на Transformer чете подканата за текст, а декодерът на Transformer след това генерира авторегресивно токените на изображението, всеки от които е обусловен от текста и от предишни емитирани токени. След като всички токени са произведени, декодерът на токенизатора реконструира пикселите. Google мащабира Parti от 350 милиона до 20 милиарда параметри, а качеството на изображението и подравняването на текста се подобряват постоянно с размера. Моделът 20B се справяше с дълги, композиционни указания, изобразяваше четлив текст и зачиташе фините детайли. Parti също представи бенчмарка PartiPrompts, набор от над 1600 предизвикателни подкани, обхващащи много категории и нива на трудност.
Техническа информация
Определящата характеристика е чистата авторегресия върху дискретни визуални токени: моделът факторизира изображението като продукт на условни вероятности за следващ токен, идентичен по дух на генерирането на текст в стил GPT. Това обединява визията и езика в една рецепта за обучение и му позволява да наследи десетилетия трикове за моделиране на последователност. Цената е последователно декодиране, тъй като токените трябва да се произвеждат в ред, което прави генерирането по-бавно от паралелните подходи, но се мащабира предвидимо и се възползва директно от по-големите модели.
Стратегическо въздействие
Speed and scale
Visual AI може да автоматизира задачи за проверка, откриване и маркиране в мащаб.
Build choices
Творческите екипи могат да създават прототипи на концепции по-бързо с по-малко ръчни ревизии.
Team and workflow
Операциите могат да използват изображения и видео сигнали, които преди са били трудни за обработка.
Бъдещето на авторегресивното изображение на Parti Pathways
Авторегресивното изображение се радва на възраждане, тъй като един и същ гръбнак може да моделира текст, изображения, аудио и видео като един поток от символи, позволявайки наистина унифицирани мултимодални модели. Изследванията се справят с основната му слабост, бавното последователно вземане на проби, със спекулативно декодиране, предсказване на паралелни токени и по-добри токенизатори. Очаквайте авторегресивни ядра в общи асистенти, които преплитат четене, разсъждения и генериране на изображения, и да видите законите за мащабиране, които повишават още повече композиционната точност и надеждното изобразяване на текст в изображението.
Внедряване в реалния свят
Изобразяване на сложни многообектни сцени от дълги описателни подкани, като специфично подреждане на животни, обекти и фонове.
Генериране на изображения, които включват четливи написани думи или знаци, където авторегресивното подреждане помага за правилното изписване на текста.
Сравнителен анализ и стрес тестване на системи от текст към изображение с помощта на пакета PartiPrompts в категории като световно познание и абстрактни концепции.
Създаване на подробни илюстрации за подкани, изискващи прецизно броене и пространствени отношения между много елементи.
Рискове и предпазни огради
Правата върху изображението и съгласието могат да се превърнат в правни рискове, ако произходът е неясен.
Производителността на модела може да варира в зависимост от осветлението, демографските данни и средата.
Фалшивите положителни резултати могат да останат незабелязани, освен ако не се наблюдават праговете на достоверност.
Пътна карта за изпълнение
Определете критерии за приемане за прецизност, извикване и разходи за грешки.
Тествайте с данни, които съответстват на реалните производствени условия.
Добавете преглед от човек за прогнози с ниска степен на сигурност или с голямо въздействие.
Проследявайте дрейфа на модела и проверявайте отново след промени в камерата или набора от данни.
Продължете да изследвате
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Parti Pathways Autoregressive Imaging quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Авторегресивно генериране на изображения
Frequently asked questions
What is Parti Pathways Autoregressive Imaging?
Parti (Pathways Autoregressive Text-to-Image) генерира картини по начина, по който езиковите модели пишат изречения: един символ на изображение наведнъж, предвиждайки следващия от всичко, което е било преди. Има значение, защото показа, че простото мащабиране на модел на последователност може да създаде поразително детайлни, бързи и верни изображения.
Как Parti генерира изображение?
Parti е авторегресивен: произвежда последователно токени за изображения, всеки от които е обусловен от текста и от предварително генерирани токени.
Какво общо рамкиране използва Parti за задачата за текст към изображение?
Parti третира генерирането като машинен превод: енкодерът чете текст, а декодерът излъчва жетони за изображения, класическа настройка от последователност към последователност.
Какво демонстрира мащабирането на Parti до 20 милиарда параметри?
Тъй като Parti нарасна от 350M на 20B параметри, както прецизността, така и бързата вярност се подобриха, включително по-добри композиционни указания и четлив текст.
Какво преобразува изображение в отделни токени за Parti?
Parti използва ViT-VQGAN, за да кодира изображения в последователности от отделни токени, които декодерът на Transformer след това се научава да предсказва.
Какъв е основният недостатък на авторегресивното декодиране на Parti?
Тъй като всеки токен зависи от предишните, генерирането е последователно и по-бавно от паралелните методи, въпреки че се мащабира предвидимо.