دليل الذكاء الاصطناعي المرئي

الصورة 2 والنشر المضبوط للمكافأة

Imagen 2 هو نموذج تحويل النص إلى صورة قائم على الانتشار الواقعي من Google، وقد تم تحسينه باستخدام ضبط المكافأة بحيث تتطابق مخرجاته بشكل أفضل مع ما يريده الأشخاص بالفعل.

قراءة لمدة دقيقتينآخر تحديث

نظرة عامة

It matters because it pairs strong image quality and accurate text rendering with alignment techniques borrowed from how chatbots are trained.

الغوص العميق

يعتمد Imagen 2 على وصفة Imagen الأصلية: يقوم نموذج لغة مجمدة كبير بتشفير المطالبة، وتقوم سلسلة من نماذج الانتشار بتحويل الضوضاء العشوائية إلى صورة مفصلة مع الحفاظ على وفائها بذلك النص. الإضافة الرئيسية هي ضبط المكافأة، حيث يقوم نموذج المكافأة المستفادة بإنشاء صور لصفات مثل المحاذاة السريعة والجماليات والواقعية، ويتم ضبط نموذج النشر بدقة لإنتاج نتائج ذات درجات أعلى. وهذا يعكس التعلم المعزز من ردود الفعل البشرية المستخدمة في نماذج اللغة. قام Imagen 2 بتحسين الواقعية الواقعية، والتهجئة الأكثر موثوقية للنص الموجود في الصورة، والدعم الفوري متعدد اللغات، والتعامل بشكل أقوى مع الموضوعات الصعبة مثل الأيدي والوجوه. كما أنها أضافت طلاءًا داخليًا ورسمًا خارجيًا، وقامت Google بإقرانها بأداة العلامات المائية SynthID لوضع علامة غير مرئية على الصور التي تم إنشاؤها بواسطة الذكاء الاصطناعي. إنه يدعم الميزات عبر منتجات Google وتجربة ImageFX.

البصيرة الفنية

يتعلم نظام Diffusion عكس عملية التشويش، مما يؤدي تدريجيًا إلى تقليل الضوضاء في حقل عشوائي إلى صورة موجهة عن طريق تضمين النص. ضبط المكافأة يقع في الأعلى: نموذج المكافأة، الذي تم تدريبه على التفضيلات البشرية، يوفر إشارة تدفع نموذج الانتشار نحو مخرجات معدلها الأشخاص أعلى، على غرار RLHF للنص. إلى جانب التوجيه الخالي من المصنفات، والذي يوازن بين الإخلاص والتنوع، يتيح ذلك لـ Imagen 2 التحسين المباشر للجودة والمواءمة الملموسة بدلاً من مطابقة توزيع التدريب فقط.

التأثير الاستراتيجي

السرعة والحجم

يمكن للذكاء الاصطناعي المرئي أتمتة مهام الفحص والكشف ووضع العلامات على نطاق واسع.

خيارات البناء

يمكن للفرق الإبداعية إنشاء نماذج أولية للمفاهيم بشكل أسرع مع عدد أقل من المراجعات اليدوية.

الفريق وسير العمل

يمكن أن تستخدم العمليات إشارات الصور والفيديو التي كان من الصعب معالجتها في السابق.

مستقبل Imagen 2 والانتشار المضبوط للمكافأة

لقد أصبح التوزيع المضبوط للمكافأة هو المسار الافتراضي لتوليد عالي الدقة ويمكن التحكم فيه، وسوف تتسع إشارات المكافأة لتشمل السلامة والواقعية والعدالة إلى جانب الجماليات. توقع ضوابط تحرير أكثر صرامة، وأخذ عينات أسرع من خلال التقطير، والمصدر القياسي عبر العلامة المائية مثل SynthID. مع نمو نماذج التفضيلات بشكل أكثر دقة لكل مستخدم، ستقوم مولدات الصور بشكل متزايد بتخصيص الأسلوب والمحتوى حسب الذوق الفردي مع الحفاظ على إمكانية تتبعها باعتبارها من صنع الذكاء الاصطناعي.

التنفيذ في العالم الحقيقي

إنشاء صور تسويقية ومنتجات باستخدام نص دقيق داخل الصورة مثل الشعارات أو التسميات القصيرة.

Inpainting لإزالة الكائنات أو استبدالها بسهولة داخل صورة موجودة.

Outpainting لتوسيع مشهد لتخطيطات أو لافتات أو نسب عرض إلى ارتفاع مختلفة.

إنشاء أصول إبداعية متعددة اللغات حيث تظهر المطالبات والنص المعروض بعدة لغات، مع وضع علامة مائية عليها باستخدام SynthID لتحديد المصدر.

المخاطر والدرابزين

يمكن أن تصبح حقوق الصور والموافقة مخاطر قانونية إذا كان المصدر غير واضح.

يمكن أن يختلف أداء النموذج عبر الإضاءة والتركيبة السكانية والبيئات.

قد تمر الإيجابيات الكاذبة دون أن يلاحظها أحد ما لم تتم مراقبة عتبات الثقة.

خارطة طريق التنفيذ

1

تحديد معايير القبول لتكاليف الدقة والاستدعاء والخطأ.

2

اختبار مع البيانات التي تتوافق مع ظروف الإنتاج الحقيقية.

3

أضف مراجعة بشرية للتنبؤات منخفضة الثقة أو عالية التأثير.

4

تتبع انحراف النموذج وإعادة التحقق من صحته بعد تغيير الكاميرا أو مجموعة البيانات.

استمر في الاستكشاف

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Imagen 2 and Reward-Tuned Diffusion quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

ابدأ الاختبار

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

الدليل التالي

نشر الفيديو مستقر

الأسئلة المتداولة

What is Imagen 2 and Reward-Tuned Diffusion?

Imagen 2 هو نموذج تحويل النص إلى صورة قائم على الانتشار الواقعي من Google، وقد تم تحسينه باستخدام ضبط المكافأة بحيث تتطابق مخرجاته بشكل أفضل مع ما يريده الأشخاص بالفعل. إنه أمر مهم لأنه يجمع بين جودة الصورة القوية وعرض النص الدقيق مع تقنيات المحاذاة المستعارة من كيفية تدريب روبوتات الدردشة.

ما هي التقنية التوليدية الأساسية التي يستخدمها Imagen 2؟

Imagen 2 هو نموذج نشر: يتعلم عكس عملية التشويش، وتحويل التشويش العشوائي إلى صورة مفصلة موجهة بالنص.

ما الذي يضيفه ضبط المكافأة إلى Imagen 2؟

يقوم ضبط المكافأة بضبط النموذج باستخدام نموذج مكافأة تم تدريبه على التفضيلات البشرية، ودفعه نحو صور ذات تصنيف أعلى وأفضل محاذاة.

ما هي التقنية من التدريب على نموذج اللغة التي يشبهها ضبط المكافأة في Imagen 2؟

يشبه ضبط المكافأة من الناحية النظرية RLHF: يقوم نموذج المكافأة المدرب على التفضيلات بتوجيه الضبط الدقيق نحو المخرجات التي يفضلها البشر.

كيف يفهم Imagen 2 مطالبة النص؟

يتبع Imagen 2 وصفة Imagen المتمثلة في استخدام نموذج لغة مجمد كبير لتشفير المطالبة في تضمينات النص المنسق.

ما هو استخدام SynthID مع صور Imagen 2؟

يضيف SynthID علامة مائية غير مرئية حتى يمكن التعرف على الصور التي تم إنشاؤها بواسطة الذكاء الاصطناعي لمعرفة مصدرها، حتى بعد بعض التعديلات.