РЪКОВОДСТВО за визуален AI

Направете видео текст към видео

Make-A-Video е системата от 2022 г. на Meta, която превръща текстова подкана в кратък видеоклип, без изобщо да се обучава върху обозначени двойки текст-видео.

2 min readПоследна актуализация

Преглед

It matters because it showed that the visual knowledge inside text-to-image models could be 'taught' to move using only unlabeled video.

Дълбоко гмуркане

Make-A-Video, обявен от Meta AI през септември 2022 г., генерира няколко секунди видео от изречение като „куче, облечено в пелерина на супергерой, летящо през небето“. Ключовият му трик е отделянето на външния вид от движението: модел текст-към-изображение (изграден върху съвместно пространство текст-изображение и дифузия в стил CLIP) научава как изглеждат нещата от милиарди изображения с надписи, докато отделни пространствено-времеви слоеве научават как се движат нещата само от немаркирано видео. Това заобикаля недостига на висококачествени двойки текст-видео. Базовият модел произвежда клипове с ниска разделителна способност и ниска честота на кадрите, след което специализирани мрежи интерполират допълнителни кадри и пространствена разделителна способност с повишен мащаб. Резултатът беше поразително последователен за ерата си, въпреки че клиповете бяха къси, размазани и склонни към трептене и изкривяване.

Техническа информация

Make-A-Video разширява навивките и вниманието при генериране на 2D изображения в 3D чрез добавяне на псевдо-времеви слоеве. Предварително обучените пространствени тегла са замразени или фино настроени, докато новите времеви слоеве научават движение от необработено видео, така че не са необходими текстови етикети за видео. След това мрежа за интерполация на кадри уплътнява времевата линия, а дифузионните модули със супер разделителна способност повишават пространствените детайли, превръщайки груба чернова с ниска разделителна способност от 16 кадъра в по-гладък, по-отчетлив клип в каскаден конвейер.

Стратегическо въздействие

Speed and scale

Visual AI може да автоматизира задачи за проверка, откриване и маркиране в мащаб.

Build choices

Творческите екипи могат да създават прототипи на концепции по-бързо с по-малко ръчни ревизии.

Team and workflow

Операциите могат да използват изображения и видео сигнали, които преди са били трудни за обработка.

Бъдещето на Make-A-Video Text-to-Video

Рецептата на Make-A-Video за предишно изображение плюс немаркирано движение постави началото на цялата вълна от текст към видео. Неговите потомци наблягат на по-дълги, с по-висока разделителна способност, стабилни във времето клипове с контролирано движение на камерата и звук. Очаквайте основната идея, повторно използване на масивни знания за изображения и евтино обучение на движение, да продължи дори когато архитектурите се изместват към базирана на трансформатор латентна дифузия и унифицирани модели, които също приемат кондициониране на изображение или видео за редактиране и продължение.

Внедряване в реалния свят

Анимиране на едно описателно изречение в кратък повтарящ се клип за публикация в социални медии

Оживяване на статична концепция като „плюшено мече, което рисува портрет“ като движеща се илюстрация

Интерполиране между две предоставени от потребителя неподвижни изображения за създаване на видео с плавен преход

Генериране на бързи чернови на въображаеми сцени за разкадровка преди всяко заснемане

Рискове и предпазни огради

Правата върху изображението и съгласието могат да се превърнат в правни рискове, ако произходът е неясен.

Производителността на модела може да варира в зависимост от осветлението, демографските данни и средата.

Фалшивите положителни резултати могат да останат незабелязани, освен ако не се наблюдават праговете на достоверност.

Пътна карта за изпълнение

1

Определете критерии за приемане за прецизност, извикване и разходи за грешки.

2

Тествайте с данни, които съответстват на реалните производствени условия.

3

Добавете преглед от човек за прогнози с ниска степен на сигурност или с голямо въздействие.

4

Проследявайте дрейфа на модела и проверявайте отново след промени в камерата или набора от данни.

Продължете да изследвате

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Make-A-Video Text-to-Video quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Sora и Text-to-Video

Frequently asked questions

What is Make-A-Video Text-to-Video?

Make-A-Video е системата от 2022 г. на Meta, която превръща текстова подкана в кратък видеоклип, без изобщо да се обучава върху обозначени двойки текст-видео. Има значение, защото показа, че визуалното познание в моделите текст-към-изображение може да бъде „научено“ да се движи, като се използва само немаркирано видео.

Кое беше основното нововъведение, което позволи на Make-A-Video да избегне нуждата от етикетирани двойки текст-видео?

Make-A-Video отделя проблема: модел от текст към изображение научава как изглеждат нещата от изображения с надписи, докато отделни времеви слоеве научават движение от необработено, неозначено видео.

Как Make-A-Video добавя възможност за движение към модел на изображение?

Той разширява 2D пространствените извивки и вниманието с нови времеви слоеве, които научават как съдържанието се променя с времето.

Какво правят етапите на интерполация на кадри и супер разделителна способност?

След груба чернова с ниска разделителна способност и ниска честота на кадрите, интерполацията добавя кадри, а модулите със супер разделителна способност повишават разделителната способност.

Какво беше типичното ограничение на продукцията на Make-A-Video?

Клиповете бяха само няколко секунди, относително ниска разделителна способност и склонни към временно трептене и изкривяване.