समाचार पर वापस जाएँ
नवीनताAI Understanding ब्रीफिंग

Apple शोधकर्ताओं ने एकीकृत पाठ और छवि निर्माण के लिए STARFlow2 का प्रस्ताव रखा है

Apple शोधकर्ता STARFlow2 का वर्णन करते हैं, एक वास्तुकला जो एक पूर्व-प्रशिक्षित दृष्टि-भाषा मॉडल को एक कारण तंत्र के माध्यम से इंटरलीव्ड टेक्स्ट और छवियों को उत्पन्न करने के लिए ऑटोरेग्रेसिव सामान्यीकरण प्रवाह के साथ जोड़ती है।

5 min readRead the primary source
Primary-source image accompanying Apple researchers propose STARFlow2 for unified text-and-image generation
प्राथमिक-स्रोत दस्तावेज़स्रोत रिकार्ड किया गया
प्रकाशक
machinelearning.apple.com
स्रोत लिंक
machinelearning.apple.comhttps://machinelearning.apple.com/research/starflow2-multimodal-generation
स्रोत प्रकार
प्राथमिक दस्तावेज़ - एक आधिकारिक घोषणा, कागज, फाइलिंग, या प्रथम-पक्ष पृष्ठ जिसे हम सीधे पढ़ते हैं।
प्रसंगइसे 60 सेकंड में समझें

यहां से प्रारंभ करें

प्रमुख शर्तें

एपीआई (एप्लिकेशन प्रोग्रामिंग इंटरफ़ेस)
एक सॉफ्टवेयर सिस्टम के लिए दूसरे सिस्टम को अनुरोध भेजने और उससे प्रतिक्रिया प्राप्त करने का एक संरचित तरीका।
दृष्टि-भाषा मॉडल (वीएलएम)
एक मल्टीमॉडल मॉडल जो दृश्य और पाठ्य सूचना को संयुक्त रूप से संसाधित करता है।
मशीन लर्निंग (एमएल)
वे विधियाँ जो सिस्टम को डेटा से पैटर्न सीखने और समय के साथ सुधार करने की अनुमति देती हैं।
स्वयं की जांच करोएआई मॉडल समझाए गए प्रश्नोत्तरी

क्या हुआ?

Apple मशीन लर्निंग रिसर्च ने STARFlow2 का वर्णन करते हुए एक पेपर प्रकाशित किया, जो एक मल्टीमॉडल जेनरेटर आर्किटेक्चर है जो इंटरलीव्ड टेक्स्ट-इमेज अनुक्रमों को समझने, तर्क करने और उत्पन्न करने के लिए बनाया गया है। लेखकों का कहना है कि सिस्टम एक पूर्व-प्रशिक्षित दृष्टि-भाषा मॉडल के साथ ऑटोरेग्रेसिव सामान्यीकरण प्रवाह का उपयोग करता है, जिसमें दोनों धाराएं एक ही कारण संरचना के तहत काम करती हैं। Apple छवि-जनरेशन और मल्टीमॉडल-अंडरस्टैंडिंग बेंचमार्क में मजबूत परिणामों की रिपोर्ट करता है, लेकिन स्रोत बेंचमार्क नाम, स्कोर या तुलना प्रदान नहीं करता है।

Apple मशीन लर्निंग रिसर्च का पेज, जिसे अगस्त 2026 में प्रकाशित के रूप में चिह्नित किया गया है, STARFlow2 को एकीकृत मल्टीमॉडल पीढ़ी में अनुसंधान के रूप में प्रस्तुत करता है। पेपर उन प्रणालियों को संबोधित करता है जो उन अनुक्रमों को संसाधित और उत्पन्न कर सकती हैं जिनमें पाठ और छवियां आपस में जुड़ी हुई हैं। Apple के लेखकों का तर्क है कि वर्तमान दृष्टिकोण संरचनात्मक रूप से खंडित हैं: कुछ अलग-अलग दृश्य टोकन पर भरोसा करते हैं जो दृश्य निष्ठा को कम कर सकते हैं, कुछ कारण भाषा पीढ़ी को पुनरावृत्त प्रसार निंदा के साथ जोड़ते हैं, और कुछ पीढ़ी के लिए दृष्टि-भाषा मॉडल को उन तरीकों से अनुकूलित करते हैं जो उनकी पूर्व-प्रशिक्षित समझ को कमजोर कर सकते हैं। ये मौजूदा दृष्टिकोणों के पेपर के लक्षण वर्णन हैं, न कि इस स्रोत द्वारा प्रदान किए गए स्वतंत्र रूप से स्थापित निष्कर्ष।

केंद्रीय प्रस्ताव भाषा और दृश्य आउटपुट के लिए एक सामान्य जेनरेटर फ्रेमवर्क के रूप में ऑटोरेग्रेसिव सामान्यीकरण प्रवाह का उपयोग करना है। रिपोर्ट की गई वास्तुकला उस पर बनाई गई है जिसे पेपर प्रेट्ज़ेल डिज़ाइन कहता है। यह लंबवत रूप से दो धाराओं को आपस में जोड़ता है: एक जमे हुए पूर्व-प्रशिक्षित दृष्टि-भाषा-मॉडल स्ट्रीम और एक TARFlow स्ट्रीम। अवशिष्ट स्किप कनेक्शन धाराओं को जोड़ते हैं, और दोनों एक ही कारण मुखौटा के तहत काम करते हैं। स्रोत ऑटोरेग्रेसिव सामान्यीकरण प्रवाह को ऑटोरेग्रेसिव ट्रांसफॉर्मर के रूप में वर्णित करता है जो बड़े भाषा मॉडल के साथ एक कारण मुखौटा, कुंजी-मूल्य-कैश तंत्र और बाएं से दाएं संरचना साझा करता है।

STARFlow2 एक एकीकृत FAE अव्यक्त स्थान के साथ एक गहरे-उथले प्रवाह डिजाइन को भी जोड़ता है। Apple का कहना है कि यह सिस्टम को कैश-अनुकूल तरीके से इंटरलीव्ड सामग्री उत्पन्न करने देता है, जिसमें टेक्स्ट और विज़ुअल आउटपुट पुन: एन्कोड किए जाने के बजाय सीधे कुंजी-मूल्य कैश में प्रवेश करते हैं। पेज का कहना है कि प्रयोग छवि-पीढ़ी और मल्टीमॉडल-समझ वाले बेंचमार्क में मजबूत प्रदर्शन दिखाते हैं, जो Apple इस मान्यता के रूप में प्रस्तुत करता है कि ऑटोरेग्रेसिव प्रवाह एकीकृत मल्टीमॉडल मॉडलिंग के लिए आधार के रूप में काम कर सकता है। हालाँकि, आपूर्ति किया गया स्रोत बेंचमार्क, रिपोर्ट स्कोर, नाम तुलना प्रणाली की पहचान नहीं करता है, डेटासेट का वर्णन नहीं करता है या कम्प्यूटेशनल लागत नहीं बताता है। इसमें यह भी नहीं बताया गया है कि मॉडल, कोड, वज़न या कोई इंटरैक्टिव प्रदर्शन उपलब्ध है या नहीं। पृष्ठ सामान्यीकरण प्रवाह के साथ वीडियो निर्माण पर संबंधित कार्य को सूचीबद्ध करता है, लेकिन वह कार्य STARFlow2 घोषणा से अलग है। दिए गए साक्ष्य के आधार पर, यह एक शोध परिणाम और वास्तुशिल्प प्रस्ताव है, न कि कोई उत्पाद लॉन्च या प्रदर्शित सार्वजनिक सेवा।

स्रोत विवरण: machinelearning.apple.com ↗

यह क्यों मायने रखता है?

कार्य मल्टीमॉडल एआई में एक संरचनात्मक समस्या को लक्षित करता है: भाषा मॉडल आम तौर पर अलग-अलग टोकन उत्पन्न करते हैं, जबकि छवियां निरंतर डेटा होती हैं और अक्सर अलग-अलग प्रसार या पुनरावृत्त प्रणालियों के माध्यम से उत्पादित होती हैं। यदि रिपोर्ट किया गया डिज़ाइन सही रहता है, तो एक एकल कारण तंत्र मल्टीमॉडल पीढ़ी को सरल बना सकता है और इंटरलीव्ड टेक्स्ट-इमेज सिस्टम को सेवा देना आसान बना सकता है। व्यावहारिक मूल्य अपुष्ट रहता है क्योंकि स्रोत कोई विलंबता, लागत, गुणवत्ता या उपलब्धता डेटा नहीं देता है।

STARFlow2 का व्यावहारिक महत्व एक मॉडल संरचना के अंदर भाषा और दृश्य पीढ़ी के बीच बेमेल को संबोधित करने का प्रयास है। पेपर के विवरण में, भाषा निर्माण को स्वाभाविक रूप से बाएं से दाएं प्रक्रिया के रूप में नियंत्रित किया जाता है, जबकि छवि निर्माण को आमतौर पर एक अलग प्रतिनिधित्व या पुनरावृत्त निरूपण प्रक्रिया के माध्यम से नियंत्रित किया जाता है। Apple के प्रस्तावित प्रवाह-आधारित दृष्टिकोण का उद्देश्य दोनों तौर-तरीकों को एक सतत, कारण अनुक्रम में रखना है। यदि स्वतंत्र मूल्यांकन दावे की पुष्टि करते हैं, तो यह शोधकर्ताओं को उन अनुप्रयोगों के लिए अधिक सुसंगत डिज़ाइन दे सकता है जिन्हें एक छवि का वर्णन करने, एक छवि बनाने, उसकी व्याख्या करने और पाठ के साथ जारी रखने के बीच वैकल्पिक करने की आवश्यकता होती है।

कैश डिज़ाइन एक और संभावित उपयोगी योगदान है। Apple का कहना है कि टेक्स्ट और विज़ुअल आउटपुट पुन: एन्कोडिंग के बिना सीधे कुंजी-मूल्य कैश में प्रवेश कर सकते हैं। सिद्धांत रूप में, यह डुप्लिकेट प्रोसेसिंग को कम कर सकता है जब कोई सिस्टम तौर-तरीकों के बीच बार-बार चलता है, खासकर लंबी इंटरलीव्ड बातचीत या पीढ़ी के कार्यों में। हालाँकि, स्रोत प्रभाव की मात्रा निर्धारित नहीं करता है। विलंबता माप, मेमोरी आंकड़े, थ्रूपुट परिणाम, सेवा लागत या समकक्ष प्रसार-आधारित या टोकन सिस्टम के साथ तुलना की कोई रिपोर्ट नहीं की गई है। इसलिए दावा किए गए लाभ को एक स्थापित परिचालन लाभ के बजाय एक वास्तुशिल्प उद्देश्य और अनुसंधान दावे के रूप में माना जाना चाहिए।

प्रस्ताव इसलिए भी मायने रखता है क्योंकि यह उच्च-निष्ठा निरंतर छवि निर्माण को जोड़ते हुए एक पूर्व-प्रशिक्षित मॉडल की मल्टीमॉडल समझ को संरक्षित करने का प्रयास करता है। Apple का कहना है कि जमी हुई दृष्टि-भाषा धारा मौजूदा समझ को बनाए रखने में मदद करती है और प्रवाह धारा दृश्य निर्माण को सक्षम बनाती है। यह संयोजन भविष्य की प्रणालियों के लिए प्रासंगिक हो सकता है जिन्हें व्याख्या और निर्माण दोनों की आवश्यकता होती है, लेकिन स्रोत यह स्थापित नहीं करता है कि कितनी समझ संरक्षित है, दृश्य निष्ठा को कैसे मापा गया था या क्या एक कार्य पर लाभ दूसरे के प्रदर्शन के मुकाबले बदल जाता है। पेपर के परिणाम मल्टीमॉडल-मॉडल अनुसंधान के लिए महत्वपूर्ण हो सकते हैं, फिर भी उनका व्यापक महत्व घोषणा से अनुपस्थित विवरणों पर निर्भर करता है।

Interactive Mechanism

इंटरैक्टिव तंत्र: यह वास्तव में कैसे काम करता है

इस विकास के पीछे अंतर्निहित प्रौद्योगिकी का अंतःक्रियात्मक रूप से अन्वेषण करें।

Document Size:128K tokens
Needle Placement Depth (Location in document):50% into text
Attention Context Buffer Map:
Target Fact (50%)
Equivalent Pages~320Standard book pages
Retrieval Accuracy99.9%Needle recall score
RAM / KV Cache5.1 GBMemory overhead
Prompt CachingActive~80% discount on reuse
Core takeaway: Million-token context windows allow querying whole codebases or legal archives in one prompt. However, KV cache memory scales with context length, making prompt caching crucial for real-time production.
इंटरएक्टिव कॉन्सेप्ट चेक+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

आगे क्या देखना है

मुख्य अगला साक्ष्य पूर्ण प्रकाशन है, जिसमें बेंचमार्क विवरण, बेसलाइन, एब्लेशन, मॉडल आकार, गणना आवश्यकताएं और कोई कोड या वजन शामिल है। शोधकर्ताओं और डेवलपर्स को यह भी परीक्षण करना चाहिए कि क्या दावा किया गया केवी-कैश लाभ लंबे इंटरलीव्ड अनुक्रमों और वास्तविक मल्टीमॉडल वर्कफ़्लोज़ पर बना रहता है। Apple ने इस स्रोत में यह नहीं कहा है कि STARFlow2 एक उत्पाद, सार्वजनिक मॉडल या आम तौर पर उपलब्ध उपकरण है, और अगस्त 2026 के भीतर सटीक प्रकाशन तिथि प्रदान नहीं की गई है।

पहला सत्यापन बिंदु संपूर्ण पेपर और उसका प्रायोगिक रिकॉर्ड है। उपयोगी अनुवर्ती साक्ष्य में छवि-पीढ़ी और मल्टीमॉडल-समझ बेंचमार्क के नाम और संस्करण, STARFlow2 और प्रासंगिक बेसलाइन के लिए संख्यात्मक परिणाम, जमे हुए दृष्टि-भाषा स्ट्रीम, TARFlow स्ट्रीम, अवशिष्ट कनेक्शन और अव्यक्त-स्थान डिज़ाइन को अलग करने वाले एब्लेशन अध्ययन, और प्रशिक्षण डेटा, मॉडल आकार और गणना के बारे में विवरण शामिल होंगे। उन विवरणों के बिना, "मजबूत प्रदर्शन" यह स्थापित करने के लिए बहुत व्यापक है कि सुधार कितना बड़ा या विश्वसनीय है।

दूसरा सवाल यह है कि क्या प्रस्तावित कारण और कैश-अनुकूल संरचना रिपोर्ट किए गए परीक्षणों से परे काम करती है। स्वतंत्र शोधकर्ताओं को पाठ और छवियों के बीच बार-बार बदलाव वाले लंबे अनुक्रमों की जांच करने की आवश्यकता होगी, क्योंकि कैश वृद्धि, मेमोरी उपयोग और त्रुटि संचय व्यावहारिक प्रदर्शन को प्रभावित कर सकते हैं। उन्हें असतत छवि टोकन या पुनरावृत्त प्रसार का उपयोग करने वाले सिस्टम के मुकाबले आउटपुट गुणवत्ता, स्थिरता, नियंत्रणीयता और सेवा लागत की तुलना भी करनी चाहिए। स्रोत इन ट्रेड-ऑफ़ के बारे में अभी तक कोई सबूत नहीं देता है, न ही यह वितरण बदलाव या कठिन मल्टीमॉडल संकेतों के तहत व्यवहार की रिपोर्ट करता है।

अंतिम प्रश्न तैनाती है. स्रोत यह नहीं बताता है कि STARFlow2 Apple उत्पाद, एपीआई, अनुसंधान भंडार या डाउनलोड करने योग्य चेकपॉइंट के माध्यम से उपलब्ध है। यह सटीक प्रकाशन दिवस भी प्रदान नहीं करता है, इसलिए बताई गई 96-घंटे की समाचार विंडो के भीतर समय को आपूर्ति की गई सामग्री से कम नहीं किया जा सकता है। अनुवर्ती रिपोर्टिंग को यह स्थापित करना चाहिए कि क्या Apple कार्यान्वयन विवरण या मॉडल कलाकृतियाँ जारी करता है, क्या बाहरी समूह परिणामों को पुन: पेश कर सकते हैं, और क्या आर्किटेक्चर वाणिज्यिक मल्टीमॉडल सिस्टम को प्रभावित करता है। तब तक, सार्थक अज्ञात उपलब्धता, प्रतिलिपि प्रस्तुत करने योग्यता, संसाधन आवश्यकताएं और स्वतंत्र रूप से मापा गया लाभ हैं।

संबंधित मार्गदर्शिकाएँ एवं प्रश्नोत्तरी

एआई मॉडल की व्याख्याट्रांसफार्मरएआई प्रशिक्षणएआई का भविष्यआप जो जानते हैं उसका परीक्षण करें - निःशुल्क AI प्रश्नोत्तरी आज़माएँहमारी शब्दावली में एआई शब्द देखेंएआई मॉडल रिलीज ट्रैकर का पालन करें
क्या यह उपयोगी पाया गया?