Авторегресійне зображення партіальних шляхів
Parti (Pathways Autoregressive Text-to-Image) генерує зображення так само, як мовні моделі пишуть речення: один маркер зображення за раз, передбачаючи наступне з усього, що було раніше.
Огляд
It matters because it showed that simply scaling a sequence model can produce strikingly detailed, prompt-faithful images.
Глибоке занурення
Parti розглядає створення зображень як проблему послідовного перекладу, схожу на машинний переклад. Токенізатор ViT-VQGAN спочатку кодує зображення в послідовність окремих токенів, взятих із вивченої кодової книги. Кодер Transformer зчитує текстову підказку, а декодер Transformer потім авторегресійно генерує маркери зображення, кожен з яких залежить від тексту та попередньо випущених маркерів. Після створення всіх токенів декодер токенізера реконструює пікселі. Google масштабував Parti з 350 мільйонів до 20 мільярдів параметрів, а якість зображення та вирівнювання тексту поступово покращувалися разом із розміром. Модель 20B обробляла довгі композиційні підказки, відтворювала розбірливий текст і зважала на дрібні деталі. Parti також представила тест PartiPrompts, набір із понад 1600 складних підказок, що охоплюють багато категорій і рівнів складності.
Технічне розуміння
Визначальною особливістю є чиста авторегресія над дискретними візуальними токенами: модель розкладає зображення на множники як добуток умовних ймовірностей наступного токена, ідентичного за духом генерації тексту в стилі GPT. Це об’єднує бачення та мову під одним навчальним рецептом і дозволяє йому успадкувати десятиліття прийомів моделювання послідовності. Вартість пов’язана з послідовним декодуванням, оскільки токени мають створюватися в порядку, що робить генерацію повільнішою, ніж паралельні підходи, але вона масштабується передбачувано та отримує прямі переваги від більших моделей.
Стратегічний вплив
Швидкість і масштаб
Візуальний штучний інтелект може автоматизувати масштабні завдання перевірки, виявлення та позначення тегами.
Створіть вибір
Творчі групи можуть створювати прототипи концепцій швидше з меншою кількістю переглядів вручну.
Команда та робочий процес
Операції можуть використовувати зображення та відеосигнали, які раніше було важко обробити.
Майбутнє авторегресійної візуалізації партіальних шляхів
Авторегресійне зображення відроджується, оскільки одна і та ж магістраль може моделювати текст, зображення, аудіо та відео як один потік маркерів, створюючи справді уніфіковані мультимодальні моделі. Дослідження вирішують його основну слабкість, повільну послідовну вибірку, за допомогою спекулятивного декодування, передбачення паралельних токенів і кращих токенізаторів. Очікуйте ядра авторегресії в загальних помічниках, які чергують читання, міркування та генерацію зображень, а також побачите, що закони масштабування ще більше підвищують точність композиції та надійне відтворення тексту в зображенні.
Реалізація в реальному світі
Візуалізація складних багатооб’єктних сцен із довгих описових підказок, таких як конкретне розташування тварин, об’єктів і фону.
Створення зображень, які містять розбірливі написані слова чи знаки, де авторегресійне впорядкування допомагає правильно написати текст.
Порівняльний аналіз і стрес-тестування систем перетворення тексту в зображення за допомогою набору PartiPrompts у таких категоріях, як світові знання та абстрактні поняття.
Створення детальних ілюстрацій для підказок, що вимагають точного підрахунку та просторових співвідношень між багатьма елементами.
Ризики та огорожі
Права на зображення та згода можуть стати юридичними ризиками, якщо походження невідоме.
Продуктивність моделі може відрізнятися залежно від освітлення, демографічних показників і середовища.
Помилкові спрацьовування можуть залишитися непоміченими, якщо не відстежувати пороги довіри.
Дорожня карта впровадження
Визначте критерії прийнятності для точності, відкликання та вартості помилок.
Тестуйте з даними, які відповідають реальним умовам виробництва.
Додайте перевірку людиною для прогнозів із низьким рівнем достовірності або високого впливу.
Відстежуйте дрейф моделі та повторно перевіряйте після зміни камери або набору даних.
Продовжуйте досліджувати
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Parti Pathways Autoregressive Imaging quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Наступний посібник
Авторегресійна генерація зображень
Часті запитання
What is Parti Pathways Autoregressive Imaging?
Parti (Pathways Autoregressive Text-to-Image) генерує зображення так само, як мовні моделі пишуть речення: один маркер зображення за раз, передбачаючи наступне з усього, що було раніше. Це важливо, оскільки воно показало, що просте масштабування моделі послідовності може створювати вражаюче деталізовані, миттєво точні зображення.
Як Parti створює зображення?
Parti є авторегресійним: він створює маркери зображень послідовно, кожен з яких залежить від тексту та попередньо згенерованих маркерів.
Яке загальне обрамлення використовує Parti для завдання перетворення тексту в зображення?
Parti розглядає генерацію як машинний переклад: кодер зчитує текст, а декодер видає маркери зображення, класична установка послідовність-послідовність.
Що продемонструвало масштабування Parti до 20 мільярдів параметрів?
Оскільки параметри Parti зросли з 350M до 20B, точність і точність підказок покращилися, включаючи кращі композиційні підказки та розбірливий текст.
Що перетворює зображення на окремі токени для Parti?
Parti використовує ViT-VQGAN для кодування зображень у послідовності дискретних токенів, які декодер Transformer потім навчається передбачати.
Який головний недолік авторегресійного декодування Parti?
Оскільки кожен маркер залежить від попередніх, генерація є послідовною та повільнішою, ніж паралельні методи, хоча масштабується передбачувано.