VQGAN وتوليف الصور Codebook
يقوم VQGAN بضغط الصور في شبكة من الرموز المنفصلة المستمدة من كتاب الرموز المكتسب، مما يسمح للمحول بتوليد الصور بنفس الطريقة التي تولد بها نماذج اللغة النص.
الغوص العميق
يجمع VQGAN، الذي تم تقديمه في ورقة عام 2021 بعنوان "Taming Transformers for High-Resolution Image Synthesis"، بين جهاز التشفير التلقائي الكمي المتجه (VQVAE) والتدريب التنافسي والإدراكي. يقوم برنامج التشفير بتعيين الصورة إلى شبكة صغيرة من نواقل المعالم؛ يتم التقاط كل متجه إلى أقرب إدخال في كتاب الرموز المكتسب، على سبيل المثال، 1024 رمزًا منفصلاً، مما يحول الصورة إلى سلسلة من الرموز المميزة للأعداد الصحيحة. يقوم جهاز فك التشفير بإعادة بناء الصورة من تلك الرموز المميزة، ويتم تدريبه باستخدام أداة تمييز GAN وفقدان الإدراك الحسي بحيث تبدو عمليات إعادة البناء حادة وليست ضبابية. نظرًا لأن الصور أصبحت الآن تسلسلات رمزية منفصلة، يمكن لمحول الانحدار الذاتي أن يصممها مثل اللغة، ويتنبأ بالرموز المميزة واحدة تلو الأخرى. اشتهرت VQGAN بدعم الأدوات الفنية المبكرة لتحويل النص إلى صورة عند إقرانها بتوجيهات CLIP.
البصيرة الفنية
العملية الأساسية هي تكميم المتجهات: يتم استبدال مخرجات التشفير المستمرة بأقرب متجهات كتاب الشفرات الخاصة بها، مع مقدر تدرج "مباشر" بحيث لا يزال بإمكان المشفر التعلم على الرغم من البحث غير القابل للتمايز. إن إضافة تمييز GAN القائم على التصحيح أعلى جهاز التشفير التلقائي هو ما يتيح لـ VQGAN استخدام شبكة رمزية أصغر بكثير (على سبيل المثال 16 × 16) من VQVAE مع الحفاظ على القوام واضحًا، مما يجعل نمذجة المحولات قابلة للتتبع.
التأثير الاستراتيجي
السرعة والحجم
يمكن للذكاء الاصطناعي المرئي أتمتة مهام الفحص والكشف ووضع العلامات على نطاق واسع.
خيارات البناء
يمكن للفرق الإبداعية إنشاء نماذج أولية للمفاهيم بشكل أسرع مع عدد أقل من المراجعات اليدوية.
الفريق وسير العمل
يمكن أن تستخدم العمليات إشارات الصور والفيديو التي كان من الصعب معالجتها في السابق.
مستقبل تركيب صور VQGAN و Codebook
أصبحت وصفة VQGAN للرمز المنفصل الأساس لنماذج الصور والفيديو القائمة على الرمز المميز، من MaskGIT إلى الأنظمة متعددة الوسائط التي تمزج الرموز المميزة للصور والنص في محول واحد. تتجه الأبحاث الآن نحو كتب رموز أكبر ذات عدد محدود أو خالية من البحث لتجنب انهيار كتب الرموز ونحو نماذج موحدة حيث تشمل نفس المفردات الصور والصوت واللغة، مما يتيح من أي جيل إلى أي جيل.
التنفيذ في العالم الحقيقي
تشفير الصورة في شبكة مقاس 16 × 16 من الرموز المميزة لكتاب الشفرات حتى يتمكن المحول من تصميمها وتجديدها
إقران VQGAN بتوجيه CLIP لإنشاء فن الذكاء الاصطناعي "VQGAN+CLIP" السريالي الذي انتشر بسرعة كبيرة في عام 2021
ضغط الصور في رموز منفصلة مدمجة للتخزين الفعال أو التدريب التوليدي النهائي
يعمل بمثابة رمز مميز للصورة داخل المولدات الأكبر القائمة على الرموز المميزة مثل MaskGIT والمحولات متعددة الوسائط
المخاطر والدرابزين
يمكن أن تصبح حقوق الصور والموافقة مخاطر قانونية إذا كان المصدر غير واضح.
يمكن أن يختلف أداء النموذج عبر الإضاءة والتركيبة السكانية والبيئات.
قد تمر الإيجابيات الكاذبة دون أن يلاحظها أحد ما لم تتم مراقبة عتبات الثقة.
خارطة طريق التنفيذ
تحديد معايير القبول لتكاليف الدقة والاستدعاء والخطأ.
اختبار مع البيانات التي تتوافق مع ظروف الإنتاج الحقيقية.
أضف مراجعة بشرية للتنبؤات منخفضة الثقة أو عالية التأثير.
تتبع انحراف النموذج وإعادة التحقق من صحته بعد تغيير الكاميرا أو مجموعة البيانات.
استمر في الاستكشاف
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the VQGAN and Codebook Image Synthesis quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
الدليل التالي
SPADE تركيب الصورة الدلالية
الأسئلة المتداولة
What is VQGAN and Codebook Image Synthesis?
يقوم VQGAN بضغط الصور في شبكة من الرموز المنفصلة المستمدة من كتاب الرموز المكتسب، مما يسمح للمحول بتوليد الصور بنفس الطريقة التي تولد بها نماذج اللغة النص.
ما الذي يستخدمه VQGAN لتمثيل الصورة كرموز منفصلة؟
يقوم VQGAN بقياس ميزات التشفير إلى أقرب الإدخالات في كتاب الرموز المكتسب، وتحويل الصورة إلى سلسلة من مؤشرات التعليمات البرمجية المنفصلة.
لماذا تضيف VQGAN أداة تمييز GAN أعلى VQVAE؟
تتيح الخسائر العدائية والإدراكية لـ VQGAN إعادة بناء صور واضحة من شبكة رمزية مدمجة، والتي يميل VQVAE وحده إلى طمسها.
بمجرد أن تكون الصورة عبارة عن سلسلة من الرموز المميزة، ما النموذج الذي يولد صورًا جديدة؟
نظرًا لأن الصور تصبح تسلسلات رمزية منفصلة، يمكن للمحول أن يصممها بشكل انحداري، تمامًا مثل توليد النص.
ما هي التقنية التي تسمح بتدفق التدرجات من خلال خطوة التكميم غير القابلة للتمييز؟
إن تكميم المتجهات غير قابل للتمييز، لذلك يستخدم VQGAN مقدر التدرج المباشر لتدريب جهاز التشفير.
ما هو الاتجاه الفني الشهير للذكاء الاصطناعي الذي ساعدت VQGAN في إنشائه في عام 2021؟
أدى إقران VQGAN مع توجيه CLIP إلى إنتاج فن "VQGAN+CLIP" المشترك على نطاق واسع والذي أدى إلى تعميم إنشاء الصور المستندة إلى النص.