تحرير التعليمات InstructPix2Pix
يتيح لك InstructPix2Pix تحرير صورة عن طريق كتابة أمر عادي مثل "اجعله شتاءً" أو "تحويل القطة إلى كلب"، دون الحاجة إلى أقنعة أو أدوات تحديد.
نظرة عامة
It taught a diffusion model to follow editing instructions directly.
الغوص العميق
InstructPix2Pix (Brooks et al., 2023) هو نموذج نشر تم ضبطه لالتقاط صورة إدخال بالإضافة إلى تعليمات نصية وإخراج الصورة المحررة في تمريرة أمامية واحدة. وتتمثل حيلتها الذكية في بيانات التدريب: استخدم المؤلفون GPT-3 لإنشاء أزواج تعليق قبل وبعد، ثم استخدموا موجه إلى مطالبة مع Stable Diffusion لتجميع أزواج الصور المتطابقة قبل/بعد. وقد منحهم ذلك مجموعة كبيرة من البيانات (الصورة الأصلية، والتعليمات، والصورة المعدلة) ثلاث مرات للتدريب عليها، وكل ذلك بدون وضع علامات يدوية. نظرًا لأن التعليمات تصف تغييرًا وليس مشهدًا كاملاً، فإن النموذج يحتفظ بأجزاء غير مذكورة من الصورة. يستخدم مقياسين للتوجيه، أحدهما لمدى دقة اتباع التعليمات والآخر لمدى التزامها بالصورة الأصلية، مما يسمح للمستخدمين بمقايضة قوة التحرير مقابل الإخلاص.
البصيرة الفنية
يطبق النموذج على كل من الصورة المصدر والتعليمات، مع تطبيق إرشادات خالية من المصنفات على محورين. يقوم أحد المقياسين بوزن التعليمات النصية، بينما يقوم الآخر بوزن الصورة المدخلة. يؤدي رفع مقياس الصورة إلى الحفاظ على جزء أكبر من النص الأصلي سليمًا، بينما يؤدي رفع مقياس النص إلى جعل عملية التحرير أكثر قوة. هذا التوجيه المزدوج هو ما يسمح لتعليمة عامة واحدة بتغيير جانب واحد بشكل موثوق مع ترك التعرف على بقية الصورة.
التأثير الاستراتيجي
السرعة والحجم
يمكن للذكاء الاصطناعي المرئي أتمتة مهام الفحص والكشف ووضع العلامات على نطاق واسع.
خيارات البناء
يمكن للفرق الإبداعية إنشاء نماذج أولية للمفاهيم بشكل أسرع مع عدد أقل من المراجعات اليدوية.
الفريق وسير العمل
يمكن أن تستخدم العمليات إشارات الصور والفيديو التي كان من الصعب معالجتها في السابق.
مستقبل تحرير تعليمات InstructPix2Pix
أصبح التحرير المعتمد على التعليمات هو الواجهة الافتراضية لأدوات الصور، وقد تم دمجه الآن في التطبيقات السائدة والتطبيقات اللاحقة مثل MagicBrush والمحررات الناشئة متعددة الأدوار. توقع الحفاظ بشكل أفضل على التفاصيل الدقيقة، والتعامل الموثوق مع التعليمات المكانية مثل "حرك المصباح إلى اليسار"، والامتداد السلس للفيديو، حيث يقوم أمر واحد بتحرير مقطع كامل. قد يتيح لك اقتران هذه النماذج مع وكلاء اللغة وصف جلسة تحرير كاملة بشكل تحادثي.
التنفيذ في العالم الحقيقي
يكتب أحد المدونين "إضافة أوراق الشجر" لإعادة تصميم صورة منظر طبيعي صيفي لمنشور موسمي.
يرشد أحد بائعي التجارة الإلكترونية إلى "تغيير لون القميص إلى اللون الأزرق الداكن" لإنتاج متغيرات ألوان المنتج من طلقة واحدة.
يقوم المعلم بتحرير صورة تاريخية باستخدام "تلوين هذا" لجعل صورة أرشيفية بالأبيض والأسود حية للدرس.
يأمر أحد منشئي الميمات "بوضع النظارات الشمسية على الكلب" دون إخفاء وجه الكلب يدويًا.
المخاطر والدرابزين
يمكن أن تصبح حقوق الصور والموافقة مخاطر قانونية إذا كان المصدر غير واضح.
يمكن أن يختلف أداء النموذج عبر الإضاءة والتركيبة السكانية والبيئات.
قد تمر الإيجابيات الكاذبة دون أن يلاحظها أحد ما لم تتم مراقبة عتبات الثقة.
خارطة طريق التنفيذ
تحديد معايير القبول لتكاليف الدقة والاستدعاء والخطأ.
اختبار مع البيانات التي تتوافق مع ظروف الإنتاج الحقيقية.
أضف مراجعة بشرية للتنبؤات منخفضة الثقة أو عالية التأثير.
تتبع انحراف النموذج وإعادة التحقق من صحته بعد تغيير الكاميرا أو مجموعة البيانات.
استمر في الاستكشاف
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the InstructPix2Pix Instruction Editing quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
الدليل التالي
DragGAN التحرير التفاعلي
الأسئلة المتداولة
What is InstructPix2Pix Instruction Editing?
يتيح لك InstructPix2Pix تحرير صورة عن طريق كتابة أمر عادي مثل "اجعله شتاءً" أو "تحويل القطة إلى كلب"، دون الحاجة إلى أقنعة أو أدوات تحديد. لقد قام بتدريس نموذج الانتشار لاتباع تعليمات التحرير مباشرة.
كيف تخبر InstructPix2Pix بما يجب تغييره؟
ما عليك سوى كتابة تعليمات مثل "اجعل الشتاء"؛ ليست هناك حاجة إلى أقنعة أو اختيار المنطقة.
كيف تم إنشاء بيانات التدريب الخاصة بـ InstructPix2Pix؟
قام المؤلفون بدمج أزواج التسميات التوضيحية التي تم إنشاؤها بواسطة GPT-3 مع تركيب الصور "موجه إلى موجه" لإنشاء ثلاثية تلقائيًا.
ما الذي يتحكم به مقياسا التوجيه في InstructPix2Pix؟
ويتحكم مقياس واحد في مدى قوة اتباع التحرير للتعليمات؛ ويتحكم الآخر في مقدار الاحتفاظ بالصورة المصدر.
لماذا يميل النموذج إلى ترك الأجزاء غير المذكورة من الصورة وحدها؟
تستهدف التعليمات تغييرًا محددًا، لذلك يحافظ النموذج على المناطق التي لم تذكرها التعليمات.
ما عدد التمريرات الأمامية التي يحتاجها InstructPix2Pix لإجراء التعديل؟
إنه نموذج نشر مشروط واحد يجمع الصورة والتعليمات معًا ويخرج التحرير.