Візуальний AI GUIDE

Muse Masked Generative Imaging

Muse — це модель перетворення тексту в зображення від Google, яка генерує зображення, заповнюючи всі замасковані маркери зображень, що робить це набагато швидше, ніж покрокове розповсюдження.

2 хвилини читанняОстаннє оновлення

Огляд

It matters because it showed you can get high-quality, well-aligned images without the slow iterative denoising that most generators rely on.

Глибоке занурення

Muse працює в дискретному просторі символів зображення. Попередньо навчений VQGAN перетворює зображення на сітку цілих токенів, як словник візуальних будівельних блоків. Під час навчання значна частина цих токенів маскується, і трансформатор навчається передбачати їх назад, залежно від вбудованих текстів із замороженої великої мовної моделі (T5-XXL). Під час генерації Muse починає з повністю замаскованої сітки та декодує в паралельних раундах, передбачаючи багато токенів на крок і повторно маскуючи найменш впевнені. Двоступеневе проектування спочатку створює сітку маркерів із низькою роздільною здатністю, а потім модель із надвисокою роздільною здатністю заповнює сітку з вищою роздільною здатністю. Оскільки десятки токенів розпізнаються одночасно, моделі параметрів 900M і 3B створюють зображення розміром 256 або 512 пікселів лише за декілька проходів вперед.

Технічне розуміння

Основним прийомом є паралельне декодування з достовірним перемаскуванням, яке часто називають вибіркою у стилі MaskGIT. Замість того, щоб передбачати один токен за раз (авторегресія) або сотні разів зменшувати шум (дифузія), Muse передбачає всі замасковані токени, зберігає найнадійніші з них і повторно маскує решту для наступного раунду. Використання замороженого текстового кодувальника T5-XXL забезпечує безкоштовне чітке розуміння мови, а робота з окремими токенами дозволяє моделі міркувати про зображення, схожі на слова.

Стратегічний вплив

Швидкість і масштаб

Візуальний штучний інтелект може автоматизувати масштабні завдання перевірки, виявлення та позначення тегами.

Створіть вибір

Творчі групи можуть створювати прототипи концепцій швидше з меншою кількістю переглядів вручну.

Команда та робочий процес

Операції можуть використовувати зображення та відеосигнали, які раніше було важко обробити.

Майбутнє генеративного зображення Muse Masked

Замасковане паралельне декодування вказує на високоякісні та справді швидкі генератори, що важливо для інтерактивного редагування та використання на пристрої. Очікуйте, що ідея передбачення токенів поєднається з методами дифузії та авторегресії відео та забезпечить миттєве замальовування, замальовування та редагування без масок. З удосконаленням дискретних токенізаторів масковане зображення може поширюватися на відео та 3D, де паралельне декодування може значно скоротити витрати на створення багатьох кадрів або переглядів.

Реалізація в реальному світі

Швидке концептуальне мистецтво та дошки настрою, де художнику потрібно багато варіацій зображення за секунди, а не за хвилини.

Нульове малювання, наприклад видалення об’єкта та заповнення моделлю замаскованої області рівномірним оточенням.

Зафарбовування, щоб розширити фотографію за її вихідні межі для банерів або іншого співвідношення сторін.

Редагування без масок, як-от зміна забарвлення собаки чи неба на захід сонця шляхом редагування текстової підказки та повторного декодування порушених токенів.

Ризики та огорожі

Права на зображення та згода можуть стати юридичними ризиками, якщо походження невідоме.

Продуктивність моделі може відрізнятися залежно від освітлення, демографічних показників і середовища.

Помилкові спрацьовування можуть залишитися непоміченими, якщо не відстежувати пороги довіри.

Дорожня карта впровадження

1

Визначте критерії прийнятності для точності, відкликання та вартості помилок.

2

Тестуйте з даними, які відповідають реальним умовам виробництва.

3

Додайте перевірку людиною для прогнозів із низьким рівнем достовірності або високого впливу.

4

Відстежуйте дрейф моделі та повторно перевіряйте після зміни камери або набору даних.

Продовжуйте досліджувати

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Muse Masked Generative Imaging quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Розпочати вікторину

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Наступний посібник

Масковані автокодери

Часті запитання

What is Muse Masked Generative Imaging?

Muse — це модель перетворення тексту в зображення від Google, яка генерує зображення, заповнюючи всі замасковані маркери зображень, що робить це набагато швидше, ніж покрокове розповсюдження. Це важливо, оскільки воно показало, що ви можете отримати високоякісні, добре вирівняні зображення без повільного ітераційного видалення шумів, на яке покладається більшість генераторів.

Що передбачає Muse під час генерації замість зменшення шуму пікселів?

Muse працює в дискретному просторі маркерів, передбачаючи замасковані маркери зображень, створені токенізатором VQGAN, а не безпосередньо над пікселями.

Чому Muse зазвичай швидше, ніж стандартні дифузійні моделі?

Muse заповнює багато замаскованих токенів одночасно і потребує лише кількох раундів декодування, на відміну від багатьох послідовних кроків усунення шумів у diffusion.

Звідки Muse бере розуміння текстової підказки?

Muse обумовлює генерацію на основі вбудованих текстів із замороженої попередньо навченої мовної моделі T5-XXL, надаючи їй сильне розуміння мови.

Яка роль ремаскінгу на основі впевненості в Muse?

Після кожного паралельного передбачення Muse зберігає найбільш впевнені токени та повторно маскує найменш впевнені для вдосконалення протягом наступних раундів.

Як Muse створює зображення з вищою роздільною здатністю?

Muse спочатку генерує сітку токенів із низькою роздільною здатністю, а потім друга модель із надвисокою роздільною здатністю створює сітку токенів із вищою роздільною здатністю.