À suivreGuide suivant
Curseurs LoRA pour l'édition d'images
IA visuelle
GUIDE DE L'IA Visuelle
L'édition d'images conversationnelle consiste à modifier une image via une série de requêtes de chat en langage simple, telles que « rendez le ciel orageux » suivi de « maintenant retirez la voiture », en utilisant un modèle multimodal qui comprend à la fois l'image et la conversation.
C’est important car cela remplace les masques, les calques et l’ingénierie rapide par des instructions quotidiennes. Cependant, cela fonctionne différemment de l'inpainting classique et peut modifier discrètement des parties de l'image que vous ne lui avez jamais demandé de toucher.
Il existe deux grandes manières pour l’IA de modifier les images. La peinture par diffusion classique commence par un masque. Vous peignez sur la région que vous souhaitez modifier et le modèle régénère uniquement cette zone pour l'adapter à l'environnement et à votre invite. Les pixels en dehors du masque restent intacts, mais vous devez savoir et marquer exactement où va le changement. Des modèles de recherche tels que InstructPix2Pix, publiés en 2022, ont montré qu’une image pouvait être modifiée à partir d’une seule instruction écrite, sans masque. Les modèles nativement multimodaux vont plus loin. Avec la génération d'images GPT-4o dans ChatGPT, lancée en mars 2025, et l'image Flash Gemini 2.5 de Google, lancée en août 2025 et surnommée Nano Banana, un modèle lit votre image téléchargée, votre texte et la conversation précédente, puis produit une nouvelle image. Parce qu'il voit l'intégralité de la conversation, il peut suivre des demandes telles que « revenir à la couleur de la veste d'il y a deux modifications » ou « tout garder, ajouter simplement de la pluie ». Il peut également raisonner sur ce qui se trouve dans l’image, par exemple quel objet est la voiture ou d’où vient la lumière. Le compromis est que ces modèles génèrent généralement une toute nouvelle image plutôt que de corriger les pixels. Les parties que vous n'avez pas mentionnées peuvent encore légèrement bouger : un visage peut perdre une certaine ressemblance, un petit texte peut changer, les textures peuvent s'adoucir. Au fil de nombreux virages, ces petits changements s'additionnent, ce qui est souvent appelé dérive. Les modèles plus récents préservent bien mieux les détails que les versions précédentes, mais la préservation est quelque chose que le modèle a appris et non une garantie. Trois idées fausses sont courantes. Le modèle de discussion ne modifie pas votre fichier d'origine ni ses calques. Il ne se souvient pas parfaitement des versions antérieures. La sortie peut ne pas correspondre à votre résolution d'origine. Pour la provenance, Google ajoute un filigrane SynthID invisible aux images de ses modèles, et OpenAI attache des métadonnées C2PA aux images générées.
L’IA visuelle peut automatiser les tâches d’inspection, de détection et de marquage à grande échelle.
Les équipes créatives peuvent prototyper des concepts plus rapidement avec moins de révisions manuelles.
Les opérations peuvent utiliser des signaux d’image et vidéo qui étaient auparavant difficiles à traiter.
Le développement se dirige vers un montage combinant chat et contrôle précis. Les fonctionnalités probables incluent le pointage ou le marquage grossier d'une région au sein de la conversation, le maintien des identités et du texte plus cohérents d'un tour à l'autre, la prise en charge de résolutions plus élevées et le renvoi de fichiers en couches adaptés aux flux de travail professionnels. Les outils de provenance tels que les filigranes et les informations d'identification de contenu se propageront probablement, bien qu'ils puissent être supprimés. Il existe également des préoccupations ouvertes. Des retouches faciles et réalistes de vraies photos simplifient la manipulation convaincante des personnes et des événements, et les plateformes limitent déjà certaines retouches impliquant de vrais individus. La manière dont les modèles équilibrent l'édition utile et l'utilisation abusive, et la fiabilité avec laquelle ils préservent les détails, détermineront si l'édition par chat remplace les outils traditionnels ou si elle se situe à côté d'eux.
Un propriétaire de boulangerie télécharge une photo de produit sur ChatGPT et demande un fond blanc uni, puis au tour suivant demande une ombre plus douce tout en gardant le même gâteau.
Un étudiant télécharge un diagramme de biologie dessiné à la main sur Gemini, demande une version numérique claire et utilise des tours de suivi pour agrandir les étiquettes et corriger un terme mal orthographié.
Un spécialiste du marketing demande une mascotte illustrée dans trois poses différentes, compare le visage et les couleurs à chaque tour et démarre une nouvelle conversation à partir de la meilleure version lorsque le personnage commence à dériver.
Un retoucheur qui a besoin de préserver chaque pixel intact utilise plutôt l'inpainting basé sur un masque dans un éditeur d'images, car seule la région masquée est régénérée.
Les droits à l’image et le consentement peuvent devenir des risques juridiques si la provenance n’est pas claire.
Les performances du modèle peuvent varier en fonction de l'éclairage, des données démographiques et des environnements.
Les faux positifs peuvent passer inaperçus si les seuils de confiance ne sont pas surveillés.
Définissez des critères d’acceptation pour la précision, le rappel et les coûts d’erreur.
Testez avec des données qui correspondent aux conditions de production réelles.
Ajoutez un examen humain pour les prédictions peu fiables ou à fort impact.
Suivez la dérive du modèle et revalidez après les modifications de la caméra ou de l’ensemble de données.
Free newsletter
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
L'édition d'images conversationnelle consiste à modifier une image via une série de requêtes de chat en langage simple, telles que « rendez le ciel orageux » suivi de « maintenant retirez la voiture », en utilisant un modèle multimodal qui comprend à la fois l'image et la conversation. C’est important car cela remplace les masques, les calques et l’ingénierie rapide par des instructions quotidiennes. Cependant, cela fonctionne différemment de l'inpainting classique et peut modifier discrètement des parties de l'image que vous ne lui avez jamais demandé de toucher.
L'inpainting laisse intacts les pixels situés à l'extérieur du masque. Les modèles de discussion multimodaux restituent généralement l'intégralité de l'image, en fonction de votre image, de votre texte et de l'historique des discussions.
Il n’existe pas de masque protégeant les zones inchangées. Le modèle doit les reproduire à partir de ce qu'il a appris, de sorte que les visages, le texte et les textures peuvent légèrement dériver.
Étant donné que le modèle voit des messages et des images antérieurs, il peut comprendre des références telles que « la couleur de la veste d'il y a deux modifications ».
InstructPix2Pix a édité des images à partir d'instructions textuelles uniquement. SynthID et C2PA sont des technologies de provenance, et Nano Banana est le surnom d'un modèle Gemini 2025.
Recommencer à partir d’une version forte réinitialise les petites modifications accumulées, et pointer le modèle vers l’original lui donne une référence plus claire.
Continuez à apprendre
Plus de guides sélectionnés pour ce sujet
À suivreGuide suivant
Curseurs LoRA pour l'édition d'images
IA visuelle