Дифузионни трансформатори
Дифузионните трансформатори (DiTs) заменят конволюционната U-Net в сърцето на генераторите на изображения и видео за гръбнак на Transformer.
Преглед
This architecture powers leading systems like Stable Diffusion 3 and OpenAI's Sora, and it scales remarkably well as you add compute.
Дълбоко гмуркане
Дифузионните модели генерират изображения, като започват от чист шум и итеративно го обезшумяват в кохерентна картина. Години наред мрежата, извършваща това обезшумяване, беше U-Net, конволюционна архитектура. Дифузионният трансформатор, представен от Peebles и Xie през 2022 г., заменя U-Net с Transformer. Изображението първо се компресира в латентно пространство, разделя се на малки петна и всеки пластир се превръща в символ, подобно на думи в езиков модел. След това Transformer обработва тези токени със самовнимание при всяка стъпка на премахване на шума. Ключова констатация беше, че производителността на DiT се подобрява предсказуемо, когато увеличавате размера на модела и намалявате размера на корекцията, следвайки чистите закони за мащабиране. Тази мащабируемост е причината системите от текст към видео и текст към изображение от висок клас да мигрират до голяма степен към гръбнаците на Transformer.
Техническа информация
Основна иновация е как DiT инжектират кондициониране като времева стъпка и текстова подкана. Вместо просто свързване, те използват нормализиране на адаптивен слой (adaLN), където мрежата предвижда параметри за мащаб и изместване за нормализиращите слоеве от сигнала за кондициониране. Вариантът adaLN-zero ги инициализира, така че всеки блок започва като функция за идентичност, стабилизирайки обучението. Пачовете се сплескват в токени, обработват се от стандартни трансформаторни блокове със самовнимание, след което се сглобяват отново и декодират обратно в пиксели.
Стратегическо въздействие
Speed and scale
Visual AI може да автоматизира задачи за проверка, откриване и маркиране в мащаб.
Build choices
Творческите екипи могат да създават прототипи на концепции по-бързо с по-малко ръчни ревизии.
Team and workflow
Операциите могат да използват изображения и видео сигнали, които преди са били трудни за обработка.
Бъдещето на дифузионните трансформатори
Дифузионните трансформатори се превръщат в гръбнак по подразбиране за генеративни медии. Техният базиран на токени дизайн ги прави естествени за обединяване на изображения, видео и дори мултимодално генериране в една мащабируема архитектура. Изследванията се стремят към по-дълго видео, по-висока резолюция и по-ефективно внимание, за да се укроти квадратичната цена на много токени. Очаквайте конвергенция между езикови и визуални модели, където подобни рецепти за мащабиране на Transformer и инфраструктура обслужват и двете, ускорявайки напредъка в световните модели и интерактивното видео.
Внедряване в реалния свят
Sora на OpenAI използва гръбнак на Transformer върху пространствено-времеви пачове, за да генерира дългоминутни видеоклипове с висока точност от текстови подкани.
Stable Diffusion 3 използва мултимодален дифузионен трансформатор (MMDiT) за по-добро подравняване на генерираните изображения с подробни текстови описания.
Изследователите мащабират DiT до милиарди параметри и наблюдават предсказуемо подобряване на качеството на изображението, насочвайки решенията за изчислителен бюджет.
Студио използва базиран на DiT модел за разширяване на къси клипове, като третира допълнителните видео кадри като допълнителни жетони за корекция за премахване на шума.
Рискове и предпазни огради
Правата върху изображението и съгласието могат да се превърнат в правни рискове, ако произходът е неясен.
Производителността на модела може да варира в зависимост от осветлението, демографските данни и средата.
Фалшивите положителни резултати могат да останат незабелязани, освен ако не се наблюдават праговете на достоверност.
Пътна карта за изпълнение
Определете критерии за приемане за прецизност, извикване и разходи за грешки.
Тествайте с данни, които съответстват на реалните производствени условия.
Добавете преглед от човек за прогнози с ниска степен на сигурност или с голямо въздействие.
Проследявайте дрейфа на модела и проверявайте отново след промени в камерата или набора от данни.
Продължете да изследвате
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Diffusion Transformers quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Пространствени трансформаторни мрежи
Frequently asked questions
What is Diffusion Transformers?
Дифузионните трансформатори (DiTs) заменят конволюционната U-Net в сърцето на генераторите на изображения и видео за гръбнак на Transformer. Тази архитектура захранва водещи системи като Stable Diffusion 3 и OpenAI на Sora и се мащабира забележително добре, когато добавяте изчисления.
Какъв компонент заменя дифузионният трансформатор в сравнение с традиционните дифузионни модели?
DiTs заменят U-Net, конволюционната мрежа, която извършва обезшумяване, с гръбнака на Transformer.
Как DiT превръща изображение в нещо, което Transformer може да обработи?
Скритият образ е разделен на малки петна и всеки пластир се превръща в токен, аналогичен на думите в езиков модел.
Какво откри оригиналният DiT документ за мащабирането?
Качеството на DiT се подобрява по чист, предвидим начин, докато увеличавате изчисленията на модела и използвате по-малки кръпки, следвайки законите за мащабиране.
Как DiTs обикновено инжектират кондициониране като времева стъпка и текстова подкана?
DiTs използват нормализиране на адаптивния слой, за да предскажат мащаба и параметрите на изместване за нормализиращите слоеве от сигнала за кондициониране.
Какво постига инициализацията 'adaLN-zero'?
adaLN-zero инициализира модулацията, така че всеки блок първоначално действа като идентичност, което стабилизира и подобрява обучението.