DragGAN التحرير التفاعلي
يتيح لك DragGAN تحرير الصورة عن طريق سحب النقاط حرفيًا: التقط نقطة واسحبها إلى الهدف، وستتشوه الصورة بشكل واقعي، مع تغيير الوضع أو الشكل أو التعبير.
نظرة عامة
It matters because it makes precise, intuitive image manipulation possible without sliders, masks, or text prompts.
الغوص العميق
قدم DragGAN، من Pan وTewari وLeimkuhler وزملاؤه في Max Planck وشركاؤه (SIGGRAPH 2023)، التحرير التفاعلي القائم على النقاط للصور التي تم إنشاؤها بواسطة GAN. يضع المستخدم نقطة "مقبض" واحدة أو أكثر على الصورة ونقاط "الهدف" المقابلة حيث يجب التحرك. يقوم DragGAN بعد ذلك بدفع الكود الكامن بشكل متكرر بحيث ينزلق المحتوى الموجود أسفل كل مقبض نحو هدفه بينما تظل بقية الصورة متماسكة. يمكنك إطالة أرجل حيوان ما، أو جعل شخص ما يبتسم، أو تدوير سيارة، أو تغيير معالم المناظر الطبيعية، كل ذلك عن طريق السحب. والأهم من ذلك، أن عمليات التحرير تحترم الصورة المتعددة التي تم تعلمها، بحيث تظل النتائج واقعية بدلاً من تلطيخ وحدات البكسل. يقيد القناع الاختياري المناطق المسموح لها بالتحرك، مما يوفر تحكمًا موضعيًا دقيقًا.
البصيرة الفنية
يعمل DragGAN في المساحة الكامنة والميزات الخاصة بـ GAN المُدربة مسبقًا. ويستخدم خطوتين متناوبتين: الإشراف على الحركة، الذي يحول الكود الكامن بحيث تتحرك الميزات القريبة من كل مقبض نحو الاتجاه المستهدف، وتتبع النقطة، الذي يعيد تحديد موقع المقبض لمتابعة الميزة التي تم تثبيتها عليها باستخدام بحث أقرب جار في خرائط الميزات. يؤدي تكرار هذه الخطوات إلى تحريك الصورة على طول مشعب GAN، مما ينتج عنه تشوهات سلسة وواقعية.
التأثير الاستراتيجي
السرعة والحجم
يمكن للذكاء الاصطناعي المرئي أتمتة مهام الفحص والكشف ووضع العلامات على نطاق واسع.
خيارات البناء
يمكن للفرق الإبداعية إنشاء نماذج أولية للمفاهيم بشكل أسرع مع عدد أقل من المراجعات اليدوية.
الفريق وسير العمل
يمكن أن تستخدم العمليات إشارات الصور والفيديو التي كان من الصعب معالجتها في السابق.
مستقبل التحرير التفاعلي DragGAN
أثار DragGAN أعمال متابعة سريعة جلبت التحكم القائم على السحب إلى نماذج الانتشار (مثل DragDiffusion وFreeDrag)، التي تتعامل مع الصور الحقيقية والمحتوى التعسفي بقوة أكبر من شبكات GAN وحدها. توقع أن يصبح تحرير السحب أداة قياسية في البرامج الإبداعية، مقترنًا بعناصر التحكم في النص والمنطقة، ويمتد إلى الفيديو والأبعاد الثلاثية حتى يتمكن المستخدمون من وضع الكائنات عبر الإطارات أو إعادة تشكيل الشبكات بشكل تفاعلي، كل ذلك مع الحفاظ على الواقعية.
التنفيذ في العالم الحقيقي
ضبط تعبيرات الصورة أو اتجاه النظر أو تصفيفة الشعر عن طريق سحب نقاط الوجه
تغيير وضعية الحيوان أو السيارة واتجاهها، مثل تدوير السيارة أو تغيير موضع رأس الأسد
إعادة تشكيل صور المنتج (إطالة الكائنات أو توسيعها أو إعادة وضعها) لنماذج التصميم بالحجم الطبيعي
ضبط صور المناظر الطبيعية أو صور الموضة عن طريق سحب الخطوط، مثل تغيير أشكال الجبال أو ملاءمة الملابس
المخاطر والدرابزين
يمكن أن تصبح حقوق الصور والموافقة مخاطر قانونية إذا كان المصدر غير واضح.
يمكن أن يختلف أداء النموذج عبر الإضاءة والتركيبة السكانية والبيئات.
قد تمر الإيجابيات الكاذبة دون أن يلاحظها أحد ما لم تتم مراقبة عتبات الثقة.
خارطة طريق التنفيذ
تحديد معايير القبول لتكاليف الدقة والاستدعاء والخطأ.
اختبار مع البيانات التي تتوافق مع ظروف الإنتاج الحقيقية.
أضف مراجعة بشرية للتنبؤات منخفضة الثقة أو عالية التأثير.
تتبع انحراف النموذج وإعادة التحقق من صحته بعد تغيير الكاميرا أو مجموعة البيانات.
استمر في الاستكشاف
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the DragGAN Interactive Editing quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
الدليل التالي
تحرير لقطة واحدة للفيديو
الأسئلة المتداولة
What is DragGAN Interactive Editing?
يتيح لك DragGAN تحرير الصورة عن طريق سحب النقاط حرفيًا: التقط نقطة واسحبها إلى الهدف، وستتشوه الصورة بشكل واقعي، مع تغيير الوضع أو الشكل أو التعبير. إنه مهم لأنه يجعل المعالجة الدقيقة والبديهية للصور ممكنة بدون أشرطة تمرير أو أقنعة أو مطالبات نصية.
كيف يقوم المستخدم بتحرير صورة في DragGAN؟
تعمل تعديلات DragGAN عن طريق وضع نقاط المقبض وسحبها إلى المواقع المستهدفة، مما يؤدي إلى تشويه الصورة وفقًا لذلك.
ما هي الخطوتين الأساسيتين المتناوبتين لـ DragGAN؟
يقوم DragGAN بتبديل الإشراف على الحركة (تحريك الميزات نحو الأهداف) وتتبع النقاط (إعادة تحديد موقع المقابض)، والتكرار حتى الانتهاء.
لماذا تبدو تعديلات DragGAN واقعية وليست مشوهة؟
ونظرًا لأن المعالجة تحدث في الفضاء الكامن لشبكة GAN المُدربة مسبقًا، فإن المخرجات تظل على مجموعة متنوعة من الصور الواقعية.
ما الذي يتحكم فيه القناع الاختياري في DragGAN؟
يتيح القناع للمستخدمين تقييد عمليات التحرير على المناطق المختارة بحيث تظل بقية الصورة ثابتة.
تم تقديم DragGAN بشكل خاص في أي مكان في عام 2023؟
تم نشر DragGAN في SIGGRAPH 2023، وهو مؤتمر رائد لرسومات الكمبيوتر.