DALL-E
DALL-E هي مجموعة OpenAI من نماذج تحويل النص إلى صورة والتي تحول الوصف المكتوب إلى صورة أصلية.
نظرة عامة
It made "type a sentence, get an image" a mainstream idea and pushed image generation from research demos into everyday tools.
الغوص العميق
تم إطلاق DALL-E في يناير 2021، لإنشاء صور من النص عن طريق التنبؤ برموز الصور واحدة تلو الأخرى، مثل نموذج لغة للبكسلات. تحول DALL-E 2 (2022) إلى نهج الانتشار الذي يسترشد بتضمينات CLIP، مما ينتج عنه نتائج أكثر وضوحًا وواقعية. قام DALL-E 3 (أكتوبر 2023) بتشديد المتابعة السريعة وهو مدمج في ChatGPT، بحيث يمكن لروبوت الدردشة إعادة كتابة طلبك التقريبي إلى مطالبة غنية بالتفاصيل قبل الإنشاء. أحد التحسينات البارزة هو عرض نص قابل للقراءة داخل الصور، مثل العلامات والملصقات، والتي شوهتها النماذج السابقة. يدعم DALL-E أيضًا الرسم الداخلي (تحرير جزء من الصورة) والرسم الخارجي (توسيعها إلى ما وراء حدودها الأصلية). فهو ينتج أشكالًا متعددة من موجه واحد، مما يساعد المستخدمين على استكشاف الخيارات الإبداعية بسرعة.
البصيرة الفنية
DALL-E 3 هو نموذج نشر: يبدأ من الضوضاء العشوائية ويزيلها خطوة بخطوة، ويتم توجيهه في كل خطوة عن طريق تشفير موجه النص الخاص بك، حتى تظهر صورة متماسكة. فهو يتدرب على مجموعات ضخمة من أزواج التسميات التوضيحية للصور، ويتعلم كيفية ربط الكلمات بالميزات المرئية والترتيبات المكانية والأنماط. تتمثل إحدى الخدع الرئيسية في تحسين التسميات التوضيحية أثناء التدريب بالإضافة إلى نموذج اللغة الذي يوسع مطالبتك القصيرة إلى مطالبة تفصيلية، ولهذا السبب يتبع DALL-E 3 التعليمات بأمانة أكبر بكثير من سابقاتها.
التأثير الاستراتيجي
السرعة والحجم
يمكن للذكاء الاصطناعي المرئي أتمتة مهام الفحص والكشف ووضع العلامات على نطاق واسع.
خيارات البناء
يمكن للفرق الإبداعية إنشاء نماذج أولية للمفاهيم بشكل أسرع مع عدد أقل من المراجعات اليدوية.
الفريق وسير العمل
يمكن أن تستخدم العمليات إشارات الصور والفيديو التي كان من الصعب معالجتها في السابق.
مستقبل DALL-E
يتم طي سلالة DALL-E في أنظمة أوسع ومتعددة الوسائط حيث يتعامل نموذج واحد مع النصوص والصور والتحريرات معًا بدلاً من استخدامها كأداة منفصلة. توقع تحريرًا أكثر إحكامًا للمحادثة ("اجعل السماء برتقالية، واحتفظ بكل شيء آخر")، وعرضًا أفضل للنص، ودقة أعلى. ستصبح إشارات المصدر مثل البيانات التعريفية والعلامات المائية لـ C2PA معيارًا لتحديد الصور التي تم إنشاؤها بواسطة الذكاء الاصطناعي. تؤدي المنافسة من نماذج Midjourney وStable Diffusion وGoogle إلى تحقيق مكاسب سريعة في الجودة، بينما ستستمر المناقشات حول بيانات التدريب وموافقة الفنان وحقوق النشر في تشكيل ما يُسمح لهذه الأنظمة بالتعلم منه.
التنفيذ في العالم الحقيقي
يقوم المدون بإنشاء رسم توضيحي مخصص لرأس مقال بدلاً من البحث في مكتبات الصور المخزنة
يقوم المعلم بإنشاء رسوم بيانية بسيطة وموضحة لشرح مفهوم العلوم للطلاب الصغار
تقوم شركة صغيرة بمحاكاة العديد من مفاهيم الشعار والتغليف قبل التعاقد مع مصمم لتحسينها
يقوم مصمم الألعاب بإنتاج فن مفاهيمي سريعًا للشخصيات والبيئات لعرض الفكرة
المخاطر والدرابزين
يمكن أن تصبح حقوق الصور والموافقة مخاطر قانونية إذا كان المصدر غير واضح.
يمكن أن يختلف أداء النموذج عبر الإضاءة والتركيبة السكانية والبيئات.
قد تمر الإيجابيات الكاذبة دون أن يلاحظها أحد ما لم تتم مراقبة عتبات الثقة.
خارطة طريق التنفيذ
تحديد معايير القبول لتكاليف الدقة والاستدعاء والخطأ.
اختبار مع البيانات التي تتوافق مع ظروف الإنتاج الحقيقية.
أضف مراجعة بشرية للتنبؤات منخفضة الثقة أو عالية التأثير.
تتبع انحراف النموذج وإعادة التحقق من صحته بعد تغيير الكاميرا أو مجموعة البيانات.
استمر في الاستكشاف
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the DALL-E quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
الدليل التالي
مجالات الإشعاع العصبي
الأسئلة المتداولة
What is DALL-E?
DALL-E هي مجموعة OpenAI من نماذج تحويل النص إلى صورة والتي تحول الوصف المكتوب إلى صورة أصلية. لقد جعلت "اكتب جملة، واحصل على صورة" فكرة سائدة ودفعت توليد الصور من العروض البحثية التجريبية إلى الأدوات اليومية.
ماذا يفعل DALL-E 3 في المقام الأول؟
DALL-E هو نظام تحويل النص إلى صورة: تصف المشهد بالكلمات وينتج صورة جديدة مطابقة لهذا الوصف.
ما هي التقنية الأساسية التي يستخدمها DALL-E 3 لإنشاء صورة؟
DALL-E 3 هو نموذج انتشار يبدأ من الضوضاء العشوائية ويحسنه خطوة بخطوة، موجهًا بموجهك، إلى صورة متماسكة.
لماذا يتبع DALL-E 3 المطالبات بشكل أفضل عند استخدامه داخل ChatGPT؟
في ChatGPT، يعيد نموذج اللغة كتابة طلب مختصر إلى مطالبة أكثر ثراءً وتحديدًا، مما يؤدي إلى تحسين مدى مطابقة الصورة لما تريده.
ما هو التحسين الملحوظ الذي تم إجراؤه على DALL-E 3 مقارنة بالإصدارات السابقة؟
كانت النماذج السابقة مشوهة للنص الموجود في الصورة، ولكن DALL-E 3 يمكنه جعل الكلمات مقروءة على اللافتات والملصقات والملصقات بشكل أكثر موثوقية.
ما الذي يتيح لك "inpainting" فعله باستخدام صورة DALL-E؟
يقوم Inpainting بتحرير جزء محدد من الصورة (على سبيل المثال، تبديل كائن) مع ترك المنطقة المحيطة سليمة.