دليل الذكاء الاصطناعي المرئي

النماذج التوليدية القائمة على النتيجة

تقوم النماذج التوليدية القائمة على النقاط بإنشاء البيانات من خلال تعلم تدرج توزيع البيانات - وهو الاتجاه الذي يجعل أي عينة صاخبة تبدو أشبه بالبيانات الحقيقية.

قراءة لمدة دقيقتينآخر تحديث

نظرة عامة

This score-function view unifies diffusion models with stochastic differential equations and underpins many modern image generators.

الغوص العميق

بدلاً من نمذجة الاحتمالية بشكل مباشر، تتعلم النماذج القائمة على النتيجة النتيجة: التدرج في كثافة احتمالية السجل فيما يتعلق بالمدخلات. إن معرفة الطريقة التي يمكن بها دفع العينة لزيادة احتمالية حدوثها تكفي لتوليد بيانات جديدة. قام يانج سونج وستيفانو إرمون في عام 2019 بتدريب شبكة لتقدير هذه النتيجة عبر العديد من مستويات الضوضاء باستخدام مطابقة درجات تقليل الضوضاء، ثم إنشاء عينات باستخدام ديناميكيات لانجفين - التنقل بشكل متكرر على طول النتيجة وإضافة القليل من الضوضاء. أظهرت ورقة SDE الخاصة بهم لعام 2021 أن نماذج الانتشار والنماذج القائمة على النتائج هما وجهان لنفس العملية المستمرة الموصوفة في المعادلة التفاضلية العشوائية. والأهم من ذلك، أن كل SDE لديه ODE "تدفق احتمالي" حتمي يشترك في نفس الهامش، مما يتيح احتمالات دقيقة وأخذ عينات سريعة.

البصيرة الفنية

من الصعب تقدير نتيجة البيانات النظيفة بشكل مباشر عندما تكون البيانات متفرقة، لذلك يتم تدريب النموذج على البيانات المضطربة بسبب الضوضاء الغوسية على مقاييس متعددة. مطابقة درجة تقليل الضوضاء تعطي هدفًا قابلاً للتتبع: درجة التوزيع المزعج تساوي اتجاه الضوضاء مقسومًا على تباين الضوضاء، لذا فإن التنبؤ بالضوضاء والتنبؤ بالنتيجة هما نفس الشيء في الأساس. يحل أخذ العينات مشكلة SDE في الوقت العكسي (أو ODE المكافئ لتدفق الاحتمال) بدءًا من الضوضاء الغوسية النقية.

التأثير الاستراتيجي

السرعة والحجم

يمكن للذكاء الاصطناعي المرئي أتمتة مهام الفحص والكشف ووضع العلامات على نطاق واسع.

خيارات البناء

يمكن للفرق الإبداعية إنشاء نماذج أولية للمفاهيم بشكل أسرع مع عدد أقل من المراجعات اليدوية.

الفريق وسير العمل

يمكن أن تستخدم العمليات إشارات الصور والفيديو التي كان من الصعب معالجتها في السابق.

مستقبل النماذج التوليدية القائمة على النتائج

يعد إطار عمل Score-SDE هو المحرك النظري وراء الكثير من تقدم الذكاء الاصطناعي التوليدي. تعمل الحلول الرقمية الأسرع، وجداول الضوضاء الأفضل، و ODE للتدفق الاحتمالي على تمكين الإنشاء في الوقت الفعلي تقريبًا وتقييم الاحتمالية بدقة. تنتشر فكرة مطابقة النتائج نفسها إلى ما هو أبعد من الصور إلى تصميم البنية الصوتية والجزيئية والبروتينية، والسحب النقطية، والمحاكاة العلمية، في حين تعتمد نماذج الاتساق ومطابقة التدفق مباشرة على أسس الوقت المستمر هذه لتقليص عملية التوليد إلى عدد قليل من الخطوات.

التنفيذ في العالم الحقيقي

تولد شبكات نقاط الضوضاء المشروطة (NCSN) وجوهًا واقعية من خلال اتباع تدرجات النتائج المستفادة عبر ديناميكيات Langevin.

إعادة بناء الصور الطبية، مثل التصوير بالرنين المغناطيسي المتسارع، حيث تعمل النتيجة المستفادة كنقطة سابقة لملء بيانات المسح ذات العينات المنخفضة.

توليد البنية الجزيئية والبروتينية في اكتشاف الأدوية، ونمذجة التكوينات الذرية ثلاثية الأبعاد مع الانتشار القائم على النتائج.

تركيب شكل موجة صوتية حيث تتجه نماذج النتائج نحو الكلام النظيف أو الموسيقى، كما هو الحال في المشفرات الصوتية القائمة على الانتشار.

المخاطر والدرابزين

يمكن أن تصبح حقوق الصور والموافقة مخاطر قانونية إذا كان المصدر غير واضح.

يمكن أن يختلف أداء النموذج عبر الإضاءة والتركيبة السكانية والبيئات.

قد تمر الإيجابيات الكاذبة دون أن يلاحظها أحد ما لم تتم مراقبة عتبات الثقة.

خارطة طريق التنفيذ

1

تحديد معايير القبول لتكاليف الدقة والاستدعاء والخطأ.

2

اختبار مع البيانات التي تتوافق مع ظروف الإنتاج الحقيقية.

3

أضف مراجعة بشرية للتنبؤات منخفضة الثقة أو عالية التأثير.

4

تتبع انحراف النموذج وإعادة التحقق من صحته بعد تغيير الكاميرا أو مجموعة البيانات.

استمر في الاستكشاف

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Score-Based Generative Models quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

ابدأ الاختبار

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

الدليل التالي

النماذج المعتمدة على الطاقة

الأسئلة المتداولة

What is Score-Based Generative Models?

تقوم النماذج التوليدية القائمة على النقاط بإنشاء البيانات من خلال تعلم تدرج توزيع البيانات - وهو الاتجاه الذي يجعل أي عينة صاخبة تبدو أشبه بالبيانات الحقيقية. تعمل طريقة عرض النتيجة والوظيفة هذه على توحيد نماذج الانتشار مع المعادلات التفاضلية العشوائية وتدعم العديد من مولدات الصور الحديثة.

ما هي بالضبط "النتيجة" التي تتعلمها هذه النماذج؟

النتيجة هي تدرج كثافة بيانات السجل فيما يتعلق بالإدخال - فهي تشير إلى الاتجاه الذي يزيد من احتمالية العينة.

لماذا يتم تدريب النماذج القائمة على النتائج على البيانات الفاسدة بسبب الضوضاء على مستويات متعددة؟

في المناطق منخفضة الكثافة السكانية، تكون النتيجة الحقيقية غير محددة بشكل جيد؛ البيانات المزعجة بمستويات ضوضاء متعددة تجعل مطابقة النتائج قابلة للمتابعة في كل مكان.

ما هو إجراء أخذ العينات الذي استخدمته النماذج المبكرة القائمة على النتائج لتوليد البيانات؟

تعمل ديناميكيات Langevin على تحريك العينة بشكل متكرر في اتجاه النتيجة وتضخ ضوضاء صغيرة، وتحول الضوضاء العشوائية تدريجيًا إلى بيانات واقعية.

ما هي العلاقة الرئيسية التي أنشأتها ورقة SDE لعام 2021؟

سونغ وآخرون. النشر الموحد والنماذج القائمة على النتيجة في إطار المعادلة التفاضلية العشوائية، مع ODE تدفق الاحتمالية الحتمية مطابقة.

كيف يرتبط التنبؤ بالضوضاء بالتنبؤ بالنتيجة في تقليل مطابقة النتيجة؟

تُظهر مطابقة درجة تقليل الضوضاء أن النتيجة تساوي الضوضاء السلبية مقسومة على تباين الضوضاء، مما يجعل التنبؤ بالضوضاء والتنبؤ بالنتيجة نفس الهدف بشكل فعال.