Édition des instructions InstructPix2Pix
InstructPix2Pix vous permet de modifier une photo en tapant une commande simple comme « passer l'hiver » ou « transformer le chat en chien », aucun masque ni outil de sélection n'est requis.
Aperçu
It taught a diffusion model to follow editing instructions directly.
Plongée profonde
InstructPix2Pix (Brooks et al., 2023) est un modèle de diffusion affiné pour prendre une image d'entrée plus une instruction textuelle et sortir l'image modifiée en un seul passage vers l'avant. Son astuce réside dans les données d'entraînement : les auteurs ont utilisé GPT-3 pour générer des paires de légendes avant et après, puis ont utilisé Prompt-to-Prompt avec diffusion stable pour synthétiser les paires d'images avant/après correspondantes. Cela leur a donné un vaste ensemble de données de triples (image originale, instructions, image modifiée) sur lesquels s'entraîner, le tout sans étiquetage manuel. Étant donné que les instructions décrivent un changement plutôt qu'une scène complète, le modèle préserve les parties non mentionnées de l'image. Il utilise deux échelles de guidage, une pour la mesure dans laquelle il suit les instructions et une pour la fidélité avec laquelle il adhère à l'image originale, permettant aux utilisateurs de choisir entre la force d'édition et la fidélité.
Aperçu technique
Le modèle conditionne à la fois l’image source et l’instruction, en appliquant un guidage sans classificateur le long de deux axes. Une échelle pondère l’instruction textuelle, l’autre pondère l’image d’entrée. L'augmentation de l'échelle de l'image permet de conserver une plus grande partie de l'original intact, tandis que l'augmentation de l'échelle du texte rend la modification plus agressive. Ce double guidage permet à une seule instruction générique de modifier de manière fiable un aspect tout en laissant le reste de la photo reconnaissable.
Impact stratégique
Vitesse et échelle
L’IA visuelle peut automatiser les tâches d’inspection, de détection et de marquage à grande échelle.
Choix de construction
Les équipes créatives peuvent prototyper des concepts plus rapidement avec moins de révisions manuelles.
Équipe et flux de travail
Les opérations peuvent utiliser des signaux d’image et vidéo qui étaient auparavant difficiles à traiter.
L'avenir de l'édition d'instructions InstructPix2Pix
L'édition basée sur les instructions est en train de devenir l'interface par défaut pour les outils d'image, désormais intégrés aux applications grand public et à leurs successeurs comme MagicBrush et les éditeurs multi-tours émergents. Attendez-vous à une meilleure préservation des détails fins, à une gestion fiable des instructions spatiales telles que « déplacer la lampe vers la gauche » et à une extension transparente à la vidéo, où une seule commande édite un clip entier. Le couplage de ces modèles avec des agents linguistiques pourrait vous permettre de décrire une session d'édition complète de manière conversationnelle.
Mise en œuvre dans le monde réel
Un blogueur tape « ajouter du feuillage d'automne » pour relooker une photo de paysage d'été pour un article saisonnier.
Un vendeur de commerce électronique demande de « changer la couleur de la chemise en bleu marine » pour produire des variantes de couleur de produit à partir d'une seule photo.
Un enseignant édite une photo historique avec « coloriser ceci » pour rendre une image d'archive en noir et blanc vivante pour une leçon.
Un créateur de mèmes ordonne de « mettre des lunettes de soleil sur le chien » sans masquer manuellement le visage du chien.
Risques et garde-fous
Les droits à l’image et le consentement peuvent devenir des risques juridiques si la provenance n’est pas claire.
Les performances du modèle peuvent varier en fonction de l'éclairage, des données démographiques et des environnements.
Les faux positifs peuvent passer inaperçus si les seuils de confiance ne sont pas surveillés.
Feuille de route de mise en œuvre
Définissez des critères d’acceptation pour la précision, le rappel et les coûts d’erreur.
Testez avec des données qui correspondent aux conditions de production réelles.
Ajoutez un examen humain pour les prédictions peu fiables ou à fort impact.
Suivez la dérive du modèle et revalidez après les modifications de la caméra ou de l’ensemble de données.
Continuez à explorer
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the InstructPix2Pix Instruction Editing quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Guide suivant
Édition interactive DragGAN
Questions fréquemment posées
What is InstructPix2Pix Instruction Editing?
InstructPix2Pix vous permet de modifier une photo en tapant une commande simple comme « passer l'hiver » ou « transformer le chat en chien », aucun masque ni outil de sélection n'est requis. Il a enseigné un modèle de diffusion pour suivre directement les instructions d'édition.
Comment dire à InstructPix2Pix quoi changer ?
Vous tapez simplement une instruction du type « faites en hiver » ; aucun masque ni sélection de région n'est nécessaire.
Comment les données de formation d'InstructPix2Pix ont-elles été créées ?
Les auteurs ont combiné des paires de légendes générées par GPT-3 avec la synthèse d’images Prompt-to-Prompt pour créer automatiquement des triples.
Que contrôlent les deux échelles de guidage d'InstructPix2Pix ?
Une échelle détermine dans quelle mesure la vérification suit les instructions ; l'autre régit la quantité de l'image source qui est préservée.
Pourquoi le modèle a-t-il tendance à laisser de côté les parties non mentionnées de l’image ?
Une instruction cible un changement spécifique, de sorte que le modèle préserve les régions que l'instruction ne mentionne pas.
De combien de passes avant InstructPix2Pix a-t-il besoin pour produire une modification ?
Il s'agit d'un modèle de diffusion conditionnelle unique qui rassemble l'image et l'instruction et génère la modification.