دليل الذكاء الاصطناعي المرئي

التصوير الانحداري الذاتي للمسارات الجزئية

يقوم Parti (مسارات الانحدار التلقائي لتحويل النص إلى صورة) بإنشاء صور بنفس الطريقة التي تكتب بها النماذج اللغوية الجمل: صورة واحدة رمزية في كل مرة، وتتنبأ بالصورة التالية من كل ما جاء قبلها.

قراءة لمدة دقيقتينآخر تحديث

نظرة عامة

It matters because it showed that simply scaling a sequence model can produce strikingly detailed, prompt-faithful images.

الغوص العميق

يتعامل بارتي مع توليد الصور على أنها مشكلة ترجمة تسلسل إلى تسلسل، مثل الترجمة الآلية. يقوم جهاز ViT-VQGAN المميز أولاً بتشفير الصورة إلى سلسلة من الرموز المنفصلة المستمدة من كتاب الرموز المكتسب. يقرأ برنامج تشفير المحول مطالبة النص، ثم يقوم جهاز فك تشفير المحول بإنشاء الرموز المميزة للصورة بشكل انحداري، كل منها مشروط بالنص والرموز المميزة المنبعثة مسبقًا. بعد إنتاج جميع الرموز المميزة، يقوم جهاز فك ترميز الرمز المميز بإعادة بناء وحدات البكسل. Google قام بتحجيم Parti من 350 مليون إلى 20 مليار معلمة، كما تحسنت جودة الصورة ومحاذاة النص بشكل مطرد مع الحجم. تعامل نموذج 20B مع المطالبات التركيبية الطويلة، وقدم نصًا مقروءًا، وتفاصيل دقيقة محترمة. قدم Parti أيضًا معيار PartiPrompts، وهو عبارة عن مجموعة تضم أكثر من 1600 مطالبة صعبة تغطي العديد من الفئات ومستويات الصعوبة.

البصيرة الفنية

السمة المميزة هي الانحدار التلقائي النقي على الرموز المرئية المنفصلة: يقوم النموذج بتحليل الصورة كمنتج لاحتمالات الرمز المميز التالي المشروط، وهو مماثل في الروح لإنشاء نص على نمط GPT. يؤدي هذا إلى توحيد الرؤية واللغة في وصفة تدريبية واحدة، ويتيح لها أن ترث عقودًا من حيل نمذجة التسلسل. التكلفة هي فك التشفير المتسلسل، حيث يجب إنتاج الرموز المميزة بالترتيب، مما يجعل التوليد أبطأ من الأساليب الموازية، ولكنه يتوسع بشكل يمكن التنبؤ به ويستفيد مباشرة من النماذج الأكبر.

التأثير الاستراتيجي

السرعة والحجم

يمكن للذكاء الاصطناعي المرئي أتمتة مهام الفحص والكشف ووضع العلامات على نطاق واسع.

خيارات البناء

يمكن للفرق الإبداعية إنشاء نماذج أولية للمفاهيم بشكل أسرع مع عدد أقل من المراجعات اليدوية.

الفريق وسير العمل

يمكن أن تستخدم العمليات إشارات الصور والفيديو التي كان من الصعب معالجتها في السابق.

مستقبل تصوير مسارات الانحدار الذاتي

يتمتع التصوير الانحداري التلقائي بالانتعاش لأن العمود الفقري نفسه يمكنه نمذجة النص والصور والصوت والفيديو كتدفق رمزي واحد، مما يتيح نماذج موحدة متعددة الوسائط حقًا. تعالج الأبحاث ضعفها الرئيسي، وهو أخذ العينات التسلسلية البطيئة، من خلال فك تشفير المضاربة، والتنبؤ بالرموز الموازية، وتحسين الرموز المميزة. توقع نوى الانحدار الذاتي داخل المساعدين العامين الذين يشذّرون القراءة والاستدلال وتوليد الصور، ورؤية قوانين القياس تدفع الدقة التركيبية وعرض النص الموثوق به داخل الصورة إلى أبعد من ذلك.

التنفيذ في العالم الحقيقي

عرض مشاهد معقدة متعددة الكائنات من مطالبات وصفية طويلة، مثل ترتيب محدد للحيوانات والأشياء والخلفيات.

إنشاء صور تتضمن كلمات أو إشارات مكتوبة مقروءة، حيث يساعد الترتيب التلقائي في تهجئة النص بشكل صحيح.

قياس الأداء واختبار الضغط على أنظمة تحويل النص إلى صورة باستخدام مجموعة PartiPrompts عبر فئات مثل المعرفة العالمية والمفاهيم المجردة.

إنتاج رسوم توضيحية تفصيلية للمطالبات التي تتطلب إحصاءً دقيقًا وعلاقات مكانية بين العديد من العناصر.

المخاطر والدرابزين

يمكن أن تصبح حقوق الصور والموافقة مخاطر قانونية إذا كان المصدر غير واضح.

يمكن أن يختلف أداء النموذج عبر الإضاءة والتركيبة السكانية والبيئات.

قد تمر الإيجابيات الكاذبة دون أن يلاحظها أحد ما لم تتم مراقبة عتبات الثقة.

خارطة طريق التنفيذ

1

تحديد معايير القبول لتكاليف الدقة والاستدعاء والخطأ.

2

اختبار مع البيانات التي تتوافق مع ظروف الإنتاج الحقيقية.

3

أضف مراجعة بشرية للتنبؤات منخفضة الثقة أو عالية التأثير.

4

تتبع انحراف النموذج وإعادة التحقق من صحته بعد تغيير الكاميرا أو مجموعة البيانات.

استمر في الاستكشاف

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Parti Pathways Autoregressive Imaging quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

ابدأ الاختبار

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

الدليل التالي

توليد الصور بالانحدار التلقائي

الأسئلة المتداولة

What is Parti Pathways Autoregressive Imaging?

يقوم Parti (مسارات الانحدار التلقائي لتحويل النص إلى صورة) بإنشاء صور بنفس الطريقة التي تكتب بها النماذج اللغوية الجمل: صورة واحدة رمزية في كل مرة، وتتنبأ بالصورة التالية من كل ما جاء قبلها. إنه أمر مهم لأنه أظهر أن مجرد توسيع نطاق نموذج التسلسل يمكن أن ينتج صورًا مفصلة بشكل مذهل ودقيقة.

كيف يقوم Parti بإنشاء صورة؟

يعد Parti انحدارًا ذاتيًا: فهو ينتج رموزًا مميزة للصور بشكل تسلسلي، كل منها مشروط بالنص والرموز المميزة التي تم إنشاؤها مسبقًا.

ما هو الإطار العام الذي يستخدمه Parti لمهمة تحويل النص إلى صورة؟

يتعامل Parti مع عملية التوليد مثل الترجمة الآلية: يقوم برنامج التشفير بقراءة النص ويقوم جهاز فك التشفير بإصدار رموز الصور، وهو إعداد كلاسيكي من تسلسل إلى تسلسل.

ما الذي أظهره توسيع نطاق Parti إلى 20 مليار معلمة؟

مع نمو Parti من 350 مليونًا إلى 20 مليار معلمة، تحسنت كل من الدقة والإخلاص السريع، بما في ذلك المطالبات التركيبية الأفضل والنص المقروء.

ما الذي يحول الصورة إلى رموز منفصلة لـ Parti؟

يستخدم Parti ViT-VQGAN لتشفير الصور إلى تسلسلات من الرموز المنفصلة التي يتعلم جهاز فك ترميز Transformer بعد ذلك التنبؤ بها.

ما هو الجانب السلبي الرئيسي لفك تشفير الانحدار الذاتي لـ Parti؟

ونظرًا لأن كل رمز مميز يعتمد على العملات السابقة، فإن الإنشاء يكون متسلسلًا وأبطأ من الطرق المتوازية، على الرغم من أنه يتوسع بشكل يمكن التنبؤ به.