Дифузійні трансформатори
Дифузійні трансформатори (DiTs) замінюють згортку U-Net у центрі генераторів зображень і відео на магістраль Transformer.
Огляд
This architecture powers leading systems like Stable Diffusion 3 and OpenAI's Sora, and it scales remarkably well as you add compute.
Глибоке занурення
Дифузійні моделі генерують зображення, починаючи з чистого шуму та ітеративно зменшуючи його в цілісну картинку. Протягом багатьох років мережа, яка виконувала таке видалення шуму, була U-Net, згортковою архітектурою. Дифузійний трансформатор, представлений Peebles і Xie у 2022 році, замінює U-Net на Transformer. Зображення спочатку стискається в латентний простір, розбивається на маленькі фрагменти, і кожен фрагмент стає маркером, подібно до слів у мовній моделі. Потім Transformer обробляє ці маркери з самоувагою на кожному кроці усунення шумів. Ключовий висновок полягав у тому, що продуктивність DiT передбачувано покращується, коли ви збільшуєте розмір моделі та зменшуєте розмір латки, дотримуючись чітких законів масштабування. Ця масштабованість є причиною того, що системи перетворення тексту у відео та високоякісні системи перетворення тексту в зображення значною мірою перейшли на магістралі Transformer.
Технічне розуміння
Основна інновація полягає в тому, як DiTs вводять умови, такі як часовий крок і текстове підказка. Замість простої конкатенації вони використовують нормалізацію адаптивного рівня (adaLN), де мережа прогнозує параметри масштабу та зсуву для шарів нормалізації з сигналу кондиціювання. Варіант adaLN-zero ініціалізує їх, тому кожен блок починається як функція ідентичності, стабілізуючи навчання. Патчі зводяться в токени, обробляються стандартними блоками Transformer із самоконтролем, потім знову збираються та декодуються назад у пікселі.
Стратегічний вплив
Швидкість і масштаб
Візуальний штучний інтелект може автоматизувати масштабні завдання перевірки, виявлення та позначення тегами.
Створіть вибір
Творчі групи можуть створювати прототипи концепцій швидше з меншою кількістю переглядів вручну.
Команда та робочий процес
Операції можуть використовувати зображення та відеосигнали, які раніше було важко обробити.
Майбутнє дифузійних трансформаторів
Дифузійні трансформатори стають основою за замовчуванням для генераторних носіїв. Їх дизайн на основі токенів робить їх природними для об’єднання зображень, відео та навіть мультимодального покоління в одній масштабованій архітектурі. Дослідження просувають довші відео, вищу роздільну здатність і ефективнішу увагу, щоб приборкати квадратичну вартість багатьох токенів. Очікуйте конвергенції між моделями мови та бачення, де схожі рецепти масштабування Transformer та інфраструктура служать обом, прискорюючи прогрес у світових моделях та інтерактивному відео.
Реалізація в реальному світі
OpenAI Sora використовує магістраль Transformer замість просторово-часових патчів для створення хвилинних високоякісних відео з текстових підказок.
Stable Diffusion 3 використовує мультимодальний дифузійний трансформатор (MMDiT) для кращого узгодження згенерованих зображень із детальними текстовими описами.
Дослідники масштабують DiT до мільярдів параметрів і спостерігають передбачуване покращення якості зображення, керуючись рішеннями щодо бюджету обчислень.
Студія використовує модель на основі DiT для подовження коротких кліпів, розглядаючи додаткові відеокадри як додаткові патч-токени для усунення шуму.
Ризики та огорожі
Права на зображення та згода можуть стати юридичними ризиками, якщо походження невідоме.
Продуктивність моделі може відрізнятися залежно від освітлення, демографічних показників і середовища.
Помилкові спрацьовування можуть залишитися непоміченими, якщо не відстежувати пороги довіри.
Дорожня карта впровадження
Визначте критерії прийнятності для точності, відкликання та вартості помилок.
Тестуйте з даними, які відповідають реальним умовам виробництва.
Додайте перевірку людиною для прогнозів із низьким рівнем достовірності або високого впливу.
Відстежуйте дрейф моделі та повторно перевіряйте після зміни камери або набору даних.
Продовжуйте досліджувати
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Diffusion Transformers quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Наступний посібник
Просторові трансформаторні мережі
Часті запитання
What is Diffusion Transformers?
Дифузійні трансформатори (DiTs) замінюють згортку U-Net у центрі генераторів зображень і відео на магістраль Transformer. Ця архітектура підтримує такі провідні системи, як Stable Diffusion 3 і OpenAI Sora, і вона надзвичайно добре масштабується, коли ви додаєте обчислення.
Який компонент замінює дифузійний трансформатор порівняно з традиційними дифузійними моделями?
DiT замінює U-Net, згортову мережу, яка виконувала шумопоглинання, на магістраль Transformer.
Як DiT перетворює зображення на щось, що може обробити Transformer?
Приховане зображення ділиться на маленькі фрагменти, і кожен фрагмент стає лексемою, аналогічною словам у мовній моделі.
Що оригінальна стаття DiT знайшла про масштабування?
Якість DiT покращується чистим, передбачуваним способом, коли ви збільшуєте обчислення моделі та використовуєте менші патчі відповідно до законів масштабування.
Як DiTs зазвичай вводять умови, такі як часовий крок і текстове підказка?
DiT використовує нормалізацію адаптивного рівня для прогнозування параметрів масштабу та зсуву для шарів нормалізації з сигналу кондиціювання.
Що досягає ініціалізація 'adaLN-zero'?
adaLN-zero ініціалізує модуляцію, тому кожен блок спочатку діє як ідентичність, що стабілізує та покращує навчання.