GUIDE DE L'IA Visuelle

Synthèse d'images VQGAN et Codebook

VQGAN compresse les images dans une grille de jetons discrets tirés d'un livre de codes appris, permettant à un transformateur de générer des images de la même manière que les modèles de langage génèrent du texte.

2 minutes de lectureDernière mise à jour

Plongée profonde

VQGAN, présenté dans l'article de 2021 « Taming Transformers for High-Resolution Image Synthesis », combine un auto-encodeur quantifié vectoriel (VQVAE) avec un entraînement contradictoire et perceptuel. Un encodeur mappe une image sur une petite grille de vecteurs de caractéristiques ; chaque vecteur est aligné sur l'entrée la plus proche dans un livre de codes appris de, disons, 1024 codes discrets, transformant l'image en une séquence de jetons entiers. Un décodeur reconstruit l'image à partir de ces jetons, entraînés avec un discriminateur GAN et une perte de perception afin que les reconstructions semblent nettes plutôt que floues. Étant donné que les images sont désormais des séquences de jetons discrètes, un transformateur autorégressif peut les modéliser comme un langage, prédisant les jetons un par un. VQGAN est célèbre pour ses premiers outils d'art de conversion texte-image lorsqu'il est associé au guidage CLIP.

Aperçu technique

L'opération principale est la quantification vectorielle : les sorties continues du codeur sont remplacées par leurs vecteurs de livre de codes les plus proches, avec un estimateur de gradient « direct » afin que le codeur puisse toujours apprendre malgré la recherche non différenciable. L'ajout d'un discriminateur GAN basé sur un correctif au-dessus de l'encodeur automatique permet à VQGAN d'utiliser une grille de jetons beaucoup plus petite (par exemple 16x16) que VQVAE tout en gardant les textures nettes, ce qui rend la modélisation du transformateur plus facile.

Impact stratégique

Vitesse et échelle

L’IA visuelle peut automatiser les tâches d’inspection, de détection et de marquage à grande échelle.

Choix de construction

Les équipes créatives peuvent prototyper des concepts plus rapidement avec moins de révisions manuelles.

Équipe et flux de travail

Les opérations peuvent utiliser des signaux d’image et vidéo qui étaient auparavant difficiles à traiter.

L'avenir de VQGAN et de la synthèse d'images Codebook

La recette de jetons discrets de VQGAN est devenue la base des modèles d'image et de vidéo basés sur des jetons, de MaskGIT aux systèmes multimodaux qui mélangent des jetons d'image et de texte dans un seul transformateur. La recherche s'oriente désormais vers des livres de codes plus grands, à échelle finie ou sans recherche, qui évitent l'effondrement des livres de codes, et vers des modèles unifiés dans lesquels le même vocabulaire couvre les images, l'audio et le langage, permettant une génération de n'importe quelle génération.

Mise en œuvre dans le monde réel

Encodage d'une photo dans une grille 16x16 de jetons de livre de codes afin qu'un transformateur puisse la modéliser et la régénérer

Associer VQGAN avec les conseils CLIP pour créer l'art IA surréaliste « VQGAN+CLIP » qui est devenu viral en 2021

Compresser les images en codes discrets compacts pour un stockage efficace ou une formation générative en aval

Servir de tokeniseur d'image dans de plus grands générateurs basés sur des jetons comme MaskGIT et des transformateurs multimodaux

Risques et garde-fous

Les droits à l’image et le consentement peuvent devenir des risques juridiques si la provenance n’est pas claire.

Les performances du modèle peuvent varier en fonction de l'éclairage, des données démographiques et des environnements.

Les faux positifs peuvent passer inaperçus si les seuils de confiance ne sont pas surveillés.

Feuille de route de mise en œuvre

1

Définissez des critères d’acceptation pour la précision, le rappel et les coûts d’erreur.

2

Testez avec des données qui correspondent aux conditions de production réelles.

3

Ajoutez un examen humain pour les prédictions peu fiables ou à fort impact.

4

Suivez la dérive du modèle et revalidez après les modifications de la caméra ou de l’ensemble de données.

Continuez à explorer

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the VQGAN and Codebook Image Synthesis quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Démarrer le quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Guide suivant

Synthèse d'images sémantiques SPADE

Questions fréquemment posées

What is VQGAN and Codebook Image Synthesis?

VQGAN compresse les images dans une grille de jetons discrets tirés d'un livre de codes appris, permettant à un transformateur de générer des images de la même manière que les modèles de langage génèrent du texte.

Qu'utilise VQGAN pour représenter une image sous forme de jetons discrets ?

VQGAN quantifie les caractéristiques de l'encodeur aux entrées les plus proches dans un livre de codes appris, transformant l'image en une séquence d'indices de code discrets.

Pourquoi VQGAN ajoute-t-il un discriminateur GAN au-dessus d'un VQVAE ?

Les pertes contradictoires et perceptuelles permettent à VQGAN de reconstruire des images nettes à partir d'une grille de jetons compacte, que VQVAE à elle seule a tendance à brouiller.

Une fois qu’une image est une séquence de jetons, quel modèle génère de nouvelles images ?

Étant donné que les images deviennent des séquences de jetons discrètes, un transformateur peut les modéliser de manière autorégressive, tout comme la génération de texte.

Quelle technique permet aux gradients de traverser l'étape de quantification non différentiable ?

La quantification vectorielle n'est pas différenciable, c'est pourquoi VQGAN utilise un estimateur de gradient direct pour entraîner l'encodeur.

Quelle célèbre tendance artistique de l’IA VQGAN a-t-il contribué à créer en 2021 ?

L'association de VQGAN avec le guidage CLIP a produit l'art largement partagé « VQGAN+CLIP » qui a popularisé la génération d'images basées sur le texte.