موسى ملثمين التصوير التوليدي
Muse هو نموذج لتحويل النص إلى صورة من Google يقوم بإنشاء الصور عن طريق ملء الرموز المميزة للصور المقنعة مرة واحدة، مما يجعله أسرع بكثير من النشر خطوة بخطوة.
نظرة عامة
الأمر مهم لأنه أظهر أنه يمكنك الحصول على صور عالية الجودة ومحاذية جيدا دون إزالة الضوضاء البطيئة التي تعتمد عليها معظم المولدات.
الغوص العميق
يعمل Muse في مساحة الرمز المنفصلة للصورة. تعمل تقنية VQGAN المُدربة مسبقًا على تحويل الصورة إلى شبكة من الرموز المميزة للأعداد الصحيحة، مثل مفردات وحدات البناء المرئية. أثناء التدريب، يتم إخفاء جزء كبير من هذه الرموز المميزة، ويتعلم المحول التنبؤ بها مرة أخرى، بشرط تضمين النص من نموذج لغة كبير متجمد (T5-XXL). في وقت الجيل، يبدأ Muse من شبكة مقنعة بالكامل ويفك التشفير في جولات متوازية، ويتنبأ بالعديد من الرموز في كل خطوة ويعيد إخفاء الأقل ثقة. يُنتج التصميم المكون من مرحلتين أولاً شبكة رمزية منخفضة الدقة، ثم يملأ النموذج فائق الدقة شبكة ذات دقة أعلى. نظرًا لأن العشرات من الرموز المميزة يتم حلها في وقت واحد، فإن نماذج المعلمات 900M و3B تنتج صورة بحجم 256 أو 512 بكسل في عدد قليل من التمريرات الأمامية فقط.
البصيرة الفنية
الحيلة الأساسية هي فك التشفير الموازي مع إعادة القناع على أساس الثقة، والتي تسمى غالبًا أخذ العينات على غرار MaskGIT. بدلاً من التنبؤ برمز واحد في كل مرة (الانحدار الذاتي) أو تقليل الضوضاء مئات المرات (الانتشار)، يتنبأ Muse بجميع الرموز المميزة المقنعة، ويحتفظ بالرموز الأكثر ثقة، ويعيد إخفاء الباقي للجولة التالية. يوفر استخدام برنامج تشفير النص T5-XXL المجمد فهمًا قويًا للغة مجانًا، كما أن التشغيل على الرموز المميزة المنفصلة يتيح للنموذج التفكير في الصور بشكل أشبه بالكلمات.
التأثير الاستراتيجي
السرعة والحجم
يمكن للذكاء الاصطناعي المرئي أتمتة مهام الفحص والكشف ووضع العلامات على نطاق واسع.
خيارات البناء
يمكن للفرق الإبداعية إنشاء نماذج أولية للمفاهيم بشكل أسرع مع عدد أقل من المراجعات اليدوية.
الفريق وسير العمل
يمكن أن تستخدم العمليات إشارات الصور والفيديو التي كان من الصعب معالجتها في السابق.
مستقبل التصوير التوليدي المقنع
يشير فك التشفير المتوازي المقنع إلى المولدات التي تتميز بالجودة العالية والسرعة الحقيقية، وهو أمر ضروري للتحرير التفاعلي والاستخدام على الجهاز. توقع أن يتم دمج فكرة التنبؤ بالرمز المميز مع طرق الفيديو الانتشارية والانحدار التلقائي، وتعزيز الرسم الداخلي الفوري، والرسم الخارجي، والتحرير بدون قناع. مع تحسن الرموز المميزة المنفصلة، قد يمتد التصوير المقنع بشكل واضح إلى الفيديو وثلاثي الأبعاد، حيث يمكن لفك التشفير الموازي أن يقلل بشكل كبير من تكلفة إنشاء العديد من الإطارات أو طرق العرض.
التنفيذ في العالم الحقيقي
فن المفهوم السريع ولوحات المزاج حيث يحتاج الفنان إلى العديد من أشكال الصور في ثوانٍ بدلاً من دقائق.
طلاء بدون لقطة، مثل إزالة كائن وجعل النموذج يملأ المنطقة المقنعة بشكل متسق مع البيئة المحيطة.
Outpainting لتوسيع الصورة إلى ما هو أبعد من حدودها الأصلية لللافتات أو نسب العرض إلى الارتفاع المختلفة.
التحرير بدون أقنعة، مثل تغيير لون الكلب أو السماء حتى غروب الشمس عن طريق تحرير مطالبة النص وإعادة فك رموز الرموز المميزة المتأثرة.
المخاطر والدرابزين
يمكن أن تصبح حقوق الصور والموافقة مخاطر قانونية إذا كان المصدر غير واضح.
يمكن أن يختلف أداء النموذج عبر الإضاءة والتركيبة السكانية والبيئات.
قد تمر الإيجابيات الكاذبة دون أن يلاحظها أحد ما لم تتم مراقبة عتبات الثقة.
خارطة طريق التنفيذ
تحديد معايير القبول لتكاليف الدقة والاستدعاء والخطأ.
اختبار مع البيانات التي تتوافق مع ظروف الإنتاج الحقيقية.
أضف مراجعة بشرية للتنبؤات منخفضة الثقة أو عالية التأثير.
تتبع انحراف النموذج وإعادة التحقق من صحته بعد تغيير الكاميرا أو مجموعة البيانات.
استمر في الاستكشاف
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Muse Masked Generative Imaging quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
الدليل التالي
أجهزة الترميز التلقائي المقنعة
الأسئلة المتداولة
ما هو التصوير التوليدي المقنع Muse؟
Muse هو نموذج لتحويل النص إلى صورة من Google يقوم بإنشاء الصور عن طريق ملء الرموز المميزة للصور المقنعة مرة واحدة، مما يجعله أسرع بكثير من النشر خطوة بخطوة. إنه أمر مهم لأنه أظهر أنه يمكنك الحصول على صور عالية الجودة ومحاذاة بشكل جيد دون تقليل الضوضاء التكرارية البطيئة التي تعتمد عليها معظم المولدات.
ما الذي يتنبأ به Muse أثناء عملية الإنشاء بدلاً من تقليل تشويش البكسلات؟
يعمل Muse في مساحة رمزية منفصلة، ويتنبأ برموز الصور المقنعة التي ينتجها رمز VQGAN المميز بدلاً من العمل على وحدات البكسل مباشرة.
لماذا يعتبر Muse بشكل عام أسرع من نماذج الانتشار القياسية؟
يملأ Muse العديد من الرموز المقنعة في وقت واحد ويحتاج فقط إلى عدد قليل من جولات فك التشفير، على عكس خطوات تقليل الضوضاء المتسلسلة العديدة الخاصة بالنشر.
من أين يحصل موسى على فهمه لموجه النص؟
يفرض Muse إنشاء تضمينات نصية من نموذج لغة T5-XXL مجمد تم تدريبه مسبقًا، مما يمنحه فهمًا قويًا للغة.
ما هو دور إعادة التشكيل على أساس الثقة في Muse؟
بعد كل تنبؤ متوازي، يحتفظ Muse بالرموز الأكثر ثقة ويعيد إخفاء الأقل ثقة لتحسينها على مدار الجولات المتعاقبة.
كيف يتعامل Muse مع إنتاج صور عالية الدقة؟
يقوم Muse أولاً بإنشاء شبكة رمزية منخفضة الدقة، ثم يقوم نموذج ثانٍ فائق الدقة بإنتاج شبكة رمزية عالية الدقة.