DALL-E
DALL-E OpenAI का टेक्स्ट-टू-इमेज मॉडल का परिवार है जो एक लिखित विवरण को मूल चित्र में बदल देता है।
सिंहावलोकन
It made "type a sentence, get an image" a mainstream idea and pushed image generation from research demos into everyday tools.
गहरा गोता
DALL-E को जनवरी 2021 में लॉन्च किया गया था, जो पिक्सेल के लिए एक भाषा मॉडल की तरह, एक समय में एक छवि टोकन की भविष्यवाणी करके पाठ से छवियां उत्पन्न करता है। DALL-E 2 (2022) CLIP एम्बेडिंग द्वारा निर्देशित एक प्रसार दृष्टिकोण पर स्विच किया गया, जिससे तेज, अधिक फोटोरिअलिस्टिक परिणाम उत्पन्न हुए। DALL-E 3 (अक्टूबर 2023) ने प्रॉम्प्ट-फ़ॉलोइंग को कड़ा कर दिया है और इसे ChatGPT में बनाया गया है, इसलिए चैटबॉट जेनरेट करने से पहले आपके मोटे अनुरोध को एक विस्तृत विस्तृत प्रॉम्प्ट में फिर से लिख सकता है। एक असाधारण सुधार छवियों के अंदर संकेतों और लेबलों जैसे पठनीय पाठ को प्रस्तुत करना है, जिसे पहले के मॉडलों ने खराब कर दिया था। DALL-E इनपेंटिंग (किसी छवि का संपादन भाग) और आउटपेंटिंग (इसे इसकी मूल सीमाओं से परे विस्तारित करना) का भी समर्थन करता है। यह एक ही प्रॉम्प्ट से कई विविधताएँ उत्पन्न करता है, जिससे उपयोगकर्ताओं को रचनात्मक विकल्पों को शीघ्रता से तलाशने में मदद मिलती है।
तकनीकी अंतर्दृष्टि
DALL-E 3 एक प्रसार मॉडल है: यह यादृच्छिक शोर से शुरू होता है और इसे चरण दर चरण हटाता है, प्रत्येक चरण पर आपके टेक्स्ट प्रॉम्प्ट के एन्कोडिंग द्वारा संचालित होता है, जब तक कि एक सुसंगत छवि उभर न जाए। यह छवि-कैप्शन जोड़े के विशाल सेट पर प्रशिक्षण देता है, यह सीखता है कि शब्द दृश्य विशेषताओं, स्थानिक व्यवस्था और शैलियों को कैसे मैप करते हैं। एक मुख्य युक्ति प्रशिक्षण के दौरान बेहतर कैप्शन और एक भाषा मॉडल है जो आपके संक्षिप्त संकेत को विस्तृत में विस्तारित करता है, यही कारण है कि DALL-E 3 अपने पूर्ववर्तियों की तुलना में कहीं अधिक ईमानदारी से निर्देशों का पालन करता है।
सामरिक प्रभाव
गति और पैमाना
विज़ुअल एआई बड़े पैमाने पर निरीक्षण, पता लगाने और टैगिंग कार्यों को स्वचालित कर सकता है।
विकल्प बनाएं
रचनात्मक टीमें कम मैन्युअल संशोधनों के साथ तेजी से अवधारणाओं का प्रोटोटाइप बना सकती हैं।
टीम और वर्कफ़्लो
संचालन छवि और वीडियो संकेतों का उपयोग कर सकते हैं जिन्हें संसाधित करना पहले कठिन था।
DALL-E का भविष्य
DALL-E की वंशावली व्यापक, मल्टीमॉडल प्रणालियों में बदल रही है जहां एक मॉडल एक अलग उपकरण के बजाय पाठ, छवियों और संपादन को एक साथ संभालता है। कड़े वार्तालाप संपादन ("आसमान को नारंगी बनाओ, बाकी सब रखें"), बेहतर पाठ प्रतिपादन और उच्च रिज़ॉल्यूशन की अपेक्षा करें। C2PA मेटाडेटा और वॉटरमार्किंग जैसे उद्गम संकेत AI-जनित छवियों को चिह्नित करने के लिए मानक बन जाएंगे। Midjourney, स्टेबल डिफ्यूजन और Google के मॉडलों से प्रतिस्पर्धा तेजी से गुणवत्ता हासिल कर रही है, जबकि प्रशिक्षण डेटा, कलाकार की सहमति और कॉपीराइट पर बहस इन प्रणालियों को सीखने की अनुमति देती रहेगी।
वास्तविक विश्व कार्यान्वयन
एक ब्लॉगर स्टॉक-फोटो लाइब्रेरी खोजने के बजाय एक लेख के लिए एक कस्टम हेडर चित्रण तैयार करता है
एक शिक्षक युवा छात्रों को विज्ञान की अवधारणा समझाने के लिए सरल, कैप्शन वाले चित्र बनाता है
एक छोटा व्यवसाय किसी डिज़ाइनर को परिष्कृत करने के लिए उसे नियुक्त करने से पहले कई लोगो और पैकेजिंग अवधारणाओं का अनुकरण करता है
एक गेम डिजाइनर किसी विचार को पेश करने के लिए पात्रों और परिवेशों के लिए तेजी से अवधारणा कला तैयार करता है
जोखिम और रेलिंग
यदि उत्पत्ति अस्पष्ट है तो छवि अधिकार और सहमति कानूनी जोखिम बन सकते हैं।
मॉडल का प्रदर्शन प्रकाश व्यवस्था, जनसांख्यिकी और वातावरण के अनुसार भिन्न हो सकता है।
जब तक आत्मविश्वास की सीमा की निगरानी नहीं की जाती, तब तक झूठी सकारात्मक बातों पर ध्यान नहीं दिया जा सकता।
कार्यान्वयन रोडमैप
सटीकता, रिकॉल और त्रुटि लागत के लिए स्वीकृति मानदंड परिभाषित करें।
वास्तविक उत्पादन स्थितियों से मेल खाने वाले डेटा के साथ परीक्षण करें।
कम-आत्मविश्वास या उच्च-प्रभाव वाली भविष्यवाणियों के लिए मानवीय समीक्षा जोड़ें।
कैमरा या डेटासेट में बदलाव के बाद मॉडल बहाव को ट्रैक करें और पुनः सत्यापित करें।
अन्वेषण करते रहें
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the DALL-E quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
अगली गाइड
तंत्रिका चमक क्षेत्र
अक्सर पूछे जाने वाले प्रश्नों
What is DALL-E?
DALL-E OpenAI का टेक्स्ट-टू-इमेज मॉडल का परिवार है जो एक लिखित विवरण को मूल चित्र में बदल देता है। इसने "एक वाक्य टाइप करें, एक छवि प्राप्त करें" को एक मुख्यधारा का विचार बना दिया और शोध डेमो से छवि निर्माण को रोजमर्रा के टूल में धकेल दिया।
DALL-E 3 मुख्य रूप से क्या करता है?
DALL-E एक टेक्स्ट-टू-इमेज प्रणाली है: आप शब्दों में एक दृश्य का वर्णन करते हैं और यह उस विवरण से मेल खाती एक नई तस्वीर तैयार करता है।
छवि बनाने के लिए DALL-E 3 किस अंतर्निहित तकनीक का उपयोग करता है?
DALL-E 3 एक प्रसार मॉडल है जो यादृच्छिक शोर से शुरू होता है और इसे चरण दर चरण परिष्कृत करता है, आपके संकेत द्वारा संचालित, एक सुसंगत छवि में।
ChatGPT के अंदर उपयोग किए जाने पर DALL-E 3 संकेतों का बेहतर ढंग से पालन क्यों करता है?
ChatGPT में, भाषा मॉडल एक संक्षिप्त अनुरोध को एक समृद्ध, अधिक विशिष्ट संकेत में फिर से लिखता है, जिससे यह सुधार होता है कि छवि कितनी ईमानदारी से आप जो चाहते थे उससे मेल खाती है।
पिछले संस्करणों की तुलना में DALL-E 3 में किया गया उल्लेखनीय सुधार क्या है?
पहले के मॉडल इन-इमेज टेक्स्ट को विकृत कर देते थे, लेकिन DALL-E 3 संकेतों, लेबलों और पोस्टरों पर सुपाठ्य शब्दों को अधिक विश्वसनीय रूप से प्रस्तुत कर सकता है।
'इनपेंटिंग' आपको DALL-E छवि के साथ क्या करने देती है?
इनपेंटिंग किसी छवि के चुने हुए भाग को संपादित करता है (उदाहरण के लिए, किसी वस्तु की अदला-बदली करना) जबकि आस-पास के क्षेत्र को बरकरार रखा जाता है।