Visuele AI-GIDS

Make-A-Video Tekst-naar-video

Make-A-Video is het 2022-systeem van Meta dat een tekstprompt omzet in een korte videoclip zonder ooit te trainen op gelabelde tekst-videoparen.

2 min readLaatst bijgewerkt

Overzicht

It matters because it showed that the visual knowledge inside text-to-image models could be 'taught' to move using only unlabeled video.

Diepe duik

Make-A-Video, aangekondigd door Meta AI in september 2022, genereert een paar seconden video uit een zin als 'een hond met een superheldencape die door de lucht vliegt'. De belangrijkste truc is het loskoppelen van uiterlijk en beweging: een tekst-naar-beeld-model (gebouwd op een gezamenlijke tekst-beeldruimte en -diffusie in CLIP-stijl) leert hoe dingen eruit zien uit miljarden ondertitelde afbeeldingen, terwijl afzonderlijke spatiotemporele lagen leren hoe dingen bewegen alleen uit ongelabelde video. Dit omzeilt de schaarste aan tekst-videoparen van hoge kwaliteit. Het basismodel produceert clips met een lage resolutie en een lage framesnelheid, waarna speciale netwerken extra frames interpoleren en de ruimtelijke resolutie opschalen. Het resultaat was opvallend coherent voor die tijd, hoewel de clips kort en wazig waren en gevoelig waren voor flikkering en kromtrekken.

Technisch inzicht

Make-A-Video breidt de convoluties en aandacht voor het genereren van 2D-beelden uit naar 3D door pseudo-temporele lagen toe te voegen. Vooraf getrainde ruimtelijke gewichten worden bevroren of verfijnd, terwijl nieuwe temporele lagen beweging leren van onbewerkte video, zodat er geen tekst-videolabels nodig zijn. Een frame-interpolatienetwerk verdicht vervolgens de tijdlijn en diffusiemodules met superresolutie verhogen de ruimtelijke details, waardoor een grove schets met 16 frames en lage resolutie wordt omgezet in een vloeiendere, scherpere clip in een gecascadeerde pijplijn.

Strategische impact

Speed and scale

Visuele AI kan inspectie-, detectie- en taggingtaken op schaal automatiseren.

Build choices

Creatieve teams kunnen concepten sneller prototypen met minder handmatige revisies.

Team and workflow

Bij bewerkingen kan gebruik worden gemaakt van beeld- en videosignalen die voorheen moeilijk te verwerken waren.

De toekomst van Make-A-Video tekst-naar-video

Het recept van Make-A-Video met beeld-voor-plus-ongelabelde beweging zorgde voor de hele tekst-naar-video-golf. Zijn nakomelingen leggen de nadruk op langere, temporeel stabiele clips met een hogere resolutie en regelbare camerabewegingen en audio. Verwacht dat het kernidee, het hergebruiken van enorme beeldkennis en het goedkoop leren van beweging, zal blijven bestaan, zelfs als architecturen verschuiven naar op transformatoren gebaseerde latente diffusie en uniforme modellen die ook beeld- of videoconditionering accepteren voor bewerking en voortzetting.

Implementatie in de echte wereld

Een enkele beschrijvende zin animeren tot een korte looping-clip voor een bericht op sociale media

Een statisch concept als 'een teddybeer die een portret schildert' tot leven brengen als bewegende illustratie

Interpolatie tussen twee door de gebruiker aangeleverde stilstaande beelden om een vloeiende overgangsvideo te creëren

Het genereren van snelle bewegende concepten van ingebeelde scènes voor storyboarding vóór het filmen

Risico's en vangrails

Beeldrechten en toestemming kunnen juridische risico's worden als de herkomst onduidelijk is.

De prestaties van modellen kunnen variëren afhankelijk van de belichting, demografische gegevens en omgevingen.

Valse positieve resultaten kunnen onopgemerkt blijven, tenzij de vertrouwensdrempels worden gecontroleerd.

Implementatie routekaart

1

Definieer acceptatiecriteria voor precisie-, terugroep- en foutkosten.

2

Test met gegevens die overeenkomen met echte productieomstandigheden.

3

Voeg menselijke beoordeling toe voor voorspellingen met weinig vertrouwen of hoge impact.

4

Volg modelafwijkingen en valideer opnieuw na wijzigingen in de camera of dataset.

Blijf verkennen

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Make-A-Video Text-to-Video quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Sora en tekst-naar-video

Frequently asked questions

What is Make-A-Video Text-to-Video?

Make-A-Video is het 2022-systeem van Meta dat een tekstprompt omzet in een korte videoclip zonder ooit te trainen op gelabelde tekst-videoparen. Het is van belang omdat het aantoonde dat de visuele kennis binnen tekst-naar-beeld-modellen kon worden 'geleerd' om te bewegen met alleen ongelabelde video.

Wat was de centrale innovatie waardoor Make-A-Video geen gelabelde tekst-video-paren nodig had?

Make-A-Video ontkoppelt het probleem: een tekst-naar-afbeelding-model leert hoe de dingen eruit zien op basis van ondertitelde afbeeldingen, terwijl afzonderlijke tijdelijke lagen beweging leren van onbewerkte, ongelabelde video.

Hoe voegt Make-A-Video bewegingsmogelijkheden toe aan een beeldmodel?

Het breidt 2D ruimtelijke convoluties en aandacht uit met nieuwe temporele lagen die leren hoe inhoud in de loop van de tijd verandert.

Wat doen de frame-interpolatie- en superresolutiefasen?

Na een grove schets met lage resolutie en lage framesnelheid, voegt interpolatie frames toe en verhogen superresolutiemodules de resolutie.

Wat was een typische beperking van de output van Make-A-Video?

Clips duurden slechts een paar seconden, hadden een relatief lage resolutie en waren gevoelig voor tijdelijke flikkering en vervorming.