Visuele AI-GIDS

Muse gemaskeerde generatieve beeldvorming

Muse is een tekst-naar-afbeelding-model van Google dat afbeeldingen genereert door gemaskeerde afbeeldingsfiches in één keer in te vullen, waardoor het veel sneller gaat dan stapsgewijze verspreiding.

2 min readLaatst bijgewerkt

Overzicht

It matters because it showed you can get high-quality, well-aligned images without the slow iterative denoising that most generators rely on.

Diepe duik

Muse werkt in de discrete symbolische ruimte van een afbeelding. Een vooraf getrainde VQGAN verandert een afbeelding in een raster van gehele tokens, als een vocabulaire van visuele bouwstenen. Tijdens de training wordt een groot deel van deze tokens gemaskeerd, en een Transformer leert ze terug te voorspellen, op basis van tekstinsluitingen uit een bevroren groot taalmodel (T5-XXL). Tijdens het genereren begint Muse vanuit een volledig gemaskeerd raster en decodeert in parallelle rondes, waarbij hij veel tokens per stap voorspelt en de minst zelfverzekerde opnieuw maskeert. Een tweetrapsontwerp produceert eerst een tokenraster met een lage resolutie, waarna een model met superresolutie een raster met een hogere resolutie vult. Omdat tientallen tokens tegelijkertijd worden verwerkt, produceren de 900M- en 3B-parametermodellen een afbeelding van 256 of 512 pixels in slechts een handvol voorwaartse passages.

Technisch inzicht

De kerntruc is parallelle decodering met op vertrouwen gebaseerde remasking, vaak MaskGIT-achtige sampling genoemd. In plaats van één token tegelijk te voorspellen (autoregressief) of honderden keren de ruis te dempen (diffusie), voorspelt Muse alle gemaskeerde tokens, behoudt de meest zelfverzekerde tokens en maskeert de rest opnieuw voor de volgende ronde. Het gebruik van een bevroren T5-XXL-tekstencoder zorgt gratis voor een sterk taalbegrip, en door te werken met discrete tokens kan het model redeneren over afbeeldingen die meer op woorden lijken.

Strategische impact

Speed and scale

Visuele AI kan inspectie-, detectie- en taggingtaken op schaal automatiseren.

Build choices

Creatieve teams kunnen concepten sneller prototypen met minder handmatige revisies.

Team and workflow

Bij bewerkingen kan gebruik worden gemaakt van beeld- en videosignalen die voorheen moeilijk te verwerken waren.

De toekomst van Muse gemaskeerde generatieve beeldvorming

Gemaskeerde parallelle decodering wijst in de richting van generatoren die zowel van hoge kwaliteit als echt snel zijn, wat essentieel is voor interactief bewerken en gebruik op het apparaat. Verwacht dat het idee van tokenvoorspelling zal samensmelten met diffusie- en autoregressieve videomethoden, en dat het instant inpainting, outpainting en maskervrije bewerking mogelijk zal maken. Naarmate discrete tokenizers verbeteren, kan gemaskeerde beeldvorming zich uitbreiden naar video en 3D, waar parallelle decodering de kosten voor het genereren van veel frames of weergaven dramatisch zou kunnen verlagen.

Implementatie in de echte wereld

Snelle conceptkunst en moodboards waarbij een kunstenaar veel beeldvariaties nodig heeft in seconden in plaats van minuten.

Zero-shot inpainting, zoals het verwijderen van een object en het model het gemaskeerde gebied consistent laten vullen met de omgeving.

Outpainting om een ​​foto buiten de oorspronkelijke grenzen uit te breiden voor banners of andere beeldverhoudingen.

Maskervrij bewerken, zoals het veranderen van de kleur van een hond of een lucht in zonsondergang door de tekstprompt te bewerken en de betreffende tokens opnieuw te decoderen.

Risico's en vangrails

Beeldrechten en toestemming kunnen juridische risico's worden als de herkomst onduidelijk is.

De prestaties van modellen kunnen variëren afhankelijk van de belichting, demografische gegevens en omgevingen.

Valse positieve resultaten kunnen onopgemerkt blijven, tenzij de vertrouwensdrempels worden gecontroleerd.

Implementatie routekaart

1

Definieer acceptatiecriteria voor precisie-, terugroep- en foutkosten.

2

Test met gegevens die overeenkomen met echte productieomstandigheden.

3

Voeg menselijke beoordeling toe voor voorspellingen met weinig vertrouwen of hoge impact.

4

Volg modelafwijkingen en valideer opnieuw na wijzigingen in de camera of dataset.

Blijf verkennen

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Muse Masked Generative Imaging quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Gemaskeerde auto-encoders

Frequently asked questions

What is Muse Masked Generative Imaging?

Muse is een tekst-naar-afbeelding-model van Google dat afbeeldingen genereert door gemaskeerde afbeeldingsfiches in één keer in te vullen, waardoor het veel sneller gaat dan stapsgewijze verspreiding. Het is belangrijk omdat het liet zien dat je goed uitgelijnde beelden van hoge kwaliteit kunt krijgen zonder de langzame iteratieve ruisonderdrukking waar de meeste generatoren op vertrouwen.

Wat voorspelt Muse tijdens het genereren in plaats van het verwijderen van ruis in pixels?

Muse opereert in een discrete tokenruimte en voorspelt gemaskeerde afbeeldingtokens die worden geproduceerd door een VQGAN-tokenizer in plaats van rechtstreeks op pixels te werken.

Waarom is Muse over het algemeen sneller dan standaard diffusiemodellen?

Muse vult veel gemaskeerde tokens tegelijkertijd in en heeft slechts een handvol decoderingsrondes nodig, in tegenstelling tot de vele opeenvolgende stappen voor het verwijderen van ruis bij diffusie.

Waar haalt Muse het begrip van de tekstprompt vandaan?

Muse conditioneert het genereren van tekstinsluitingen vanuit een bevroren, vooraf getraind T5-XXL-taalmodel, waardoor het een sterk taalbegrip krijgt.

Wat is de rol van op vertrouwen gebaseerde remasking in Muse?

Na elke parallelle voorspelling behoudt Muse de meest zelfverzekerde tokens en maskeert de minst zelfverzekerde tokens opnieuw om deze gedurende opeenvolgende rondes te verfijnen.

Hoe gaat Muse om met het produceren van afbeeldingen met een hogere resolutie?

Muse genereert eerst een tokenraster met een lage resolutie, waarna een tweede model met superresolutie een tokenraster met een hogere resolutie produceert.