क्या हुआ?
Apple मशीन लर्निंग रिसर्च ने STARFlow2 का वर्णन करते हुए एक पेपर प्रकाशित किया, जो एक मल्टीमॉडल जेनरेटर आर्किटेक्चर है जो इंटरलीव्ड टेक्स्ट-इमेज अनुक्रमों को समझने, तर्क करने और उत्पन्न करने के लिए बनाया गया है। लेखकों का कहना है कि सिस्टम एक पूर्व-प्रशिक्षित दृष्टि-भाषा मॉडल के साथ ऑटोरेग्रेसिव सामान्यीकरण प्रवाह का उपयोग करता है, जिसमें दोनों धाराएं एक ही कारण संरचना के तहत काम करती हैं। Apple छवि-जनरेशन और मल्टीमॉडल-अंडरस्टैंडिंग बेंचमार्क में मजबूत परिणामों की रिपोर्ट करता है, लेकिन स्रोत बेंचमार्क नाम, स्कोर या तुलना प्रदान नहीं करता है।
Apple मशीन लर्निंग रिसर्च का पेज, जिसे अगस्त 2026 में प्रकाशित के रूप में चिह्नित किया गया है, STARFlow2 को एकीकृत मल्टीमॉडल पीढ़ी में अनुसंधान के रूप में प्रस्तुत करता है। पेपर उन प्रणालियों को संबोधित करता है जो उन अनुक्रमों को संसाधित और उत्पन्न कर सकती हैं जिनमें पाठ और छवियां आपस में जुड़ी हुई हैं। Apple के लेखकों का तर्क है कि वर्तमान दृष्टिकोण संरचनात्मक रूप से खंडित हैं: कुछ अलग-अलग दृश्य टोकन पर भरोसा करते हैं जो दृश्य निष्ठा को कम कर सकते हैं, कुछ कारण भाषा पीढ़ी को पुनरावृत्त प्रसार निंदा के साथ जोड़ते हैं, और कुछ पीढ़ी के लिए दृष्टि-भाषा मॉडल को उन तरीकों से अनुकूलित करते हैं जो उनकी पूर्व-प्रशिक्षित समझ को कमजोर कर सकते हैं। ये मौजूदा दृष्टिकोणों के पेपर के लक्षण वर्णन हैं, न कि इस स्रोत द्वारा प्रदान किए गए स्वतंत्र रूप से स्थापित निष्कर्ष।
केंद्रीय प्रस्ताव भाषा और दृश्य आउटपुट के लिए एक सामान्य जेनरेटर फ्रेमवर्क के रूप में ऑटोरेग्रेसिव सामान्यीकरण प्रवाह का उपयोग करना है। रिपोर्ट की गई वास्तुकला उस पर बनाई गई है जिसे पेपर प्रेट्ज़ेल डिज़ाइन कहता है। यह लंबवत रूप से दो धाराओं को आपस में जोड़ता है: एक जमे हुए पूर्व-प्रशिक्षित दृष्टि-भाषा-मॉडल स्ट्रीम और एक TARFlow स्ट्रीम। अवशिष्ट स्किप कनेक्शन धाराओं को जोड़ते हैं, और दोनों एक ही कारण मुखौटा के तहत काम करते हैं। स्रोत ऑटोरेग्रेसिव सामान्यीकरण प्रवाह को ऑटोरेग्रेसिव ट्रांसफॉर्मर के रूप में वर्णित करता है जो बड़े भाषा मॉडल के साथ एक कारण मुखौटा, कुंजी-मूल्य-कैश तंत्र और बाएं से दाएं संरचना साझा करता है।
STARFlow2 एक एकीकृत FAE अव्यक्त स्थान के साथ एक गहरे-उथले प्रवाह डिजाइन को भी जोड़ता है। Apple का कहना है कि यह सिस्टम को कैश-अनुकूल तरीके से इंटरलीव्ड सामग्री उत्पन्न करने देता है, जिसमें टेक्स्ट और विज़ुअल आउटपुट पुन: एन्कोड किए जाने के बजाय सीधे कुंजी-मूल्य कैश में प्रवेश करते हैं। पेज का कहना है कि प्रयोग छवि-पीढ़ी और मल्टीमॉडल-समझ वाले बेंचमार्क में मजबूत प्रदर्शन दिखाते हैं, जो Apple इस मान्यता के रूप में प्रस्तुत करता है कि ऑटोरेग्रेसिव प्रवाह एकीकृत मल्टीमॉडल मॉडलिंग के लिए आधार के रूप में काम कर सकता है। हालाँकि, आपूर्ति किया गया स्रोत बेंचमार्क, रिपोर्ट स्कोर, नाम तुलना प्रणाली की पहचान नहीं करता है, डेटासेट का वर्णन नहीं करता है या कम्प्यूटेशनल लागत नहीं बताता है। इसमें यह भी नहीं बताया गया है कि मॉडल, कोड, वज़न या कोई इंटरैक्टिव प्रदर्शन उपलब्ध है या नहीं। पृष्ठ सामान्यीकरण प्रवाह के साथ वीडियो निर्माण पर संबंधित कार्य को सूचीबद्ध करता है, लेकिन वह कार्य STARFlow2 घोषणा से अलग है। दिए गए साक्ष्य के आधार पर, यह एक शोध परिणाम और वास्तुशिल्प प्रस्ताव है, न कि कोई उत्पाद लॉन्च या प्रदर्शित सार्वजनिक सेवा।
स्रोत विवरण: machinelearning.apple.com ↗
यह क्यों मायने रखता है?
कार्य मल्टीमॉडल एआई में एक संरचनात्मक समस्या को लक्षित करता है: भाषा मॉडल आम तौर पर अलग-अलग टोकन उत्पन्न करते हैं, जबकि छवियां निरंतर डेटा होती हैं और अक्सर अलग-अलग प्रसार या पुनरावृत्त प्रणालियों के माध्यम से उत्पादित होती हैं। यदि रिपोर्ट किया गया डिज़ाइन सही रहता है, तो एक एकल कारण तंत्र मल्टीमॉडल पीढ़ी को सरल बना सकता है और इंटरलीव्ड टेक्स्ट-इमेज सिस्टम को सेवा देना आसान बना सकता है। व्यावहारिक मूल्य अपुष्ट रहता है क्योंकि स्रोत कोई विलंबता, लागत, गुणवत्ता या उपलब्धता डेटा नहीं देता है।
STARFlow2 का व्यावहारिक महत्व एक मॉडल संरचना के अंदर भाषा और दृश्य पीढ़ी के बीच बेमेल को संबोधित करने का प्रयास है। पेपर के विवरण में, भाषा निर्माण को स्वाभाविक रूप से बाएं से दाएं प्रक्रिया के रूप में नियंत्रित किया जाता है, जबकि छवि निर्माण को आमतौर पर एक अलग प्रतिनिधित्व या पुनरावृत्त निरूपण प्रक्रिया के माध्यम से नियंत्रित किया जाता है। Apple के प्रस्तावित प्रवाह-आधारित दृष्टिकोण का उद्देश्य दोनों तौर-तरीकों को एक सतत, कारण अनुक्रम में रखना है। यदि स्वतंत्र मूल्यांकन दावे की पुष्टि करते हैं, तो यह शोधकर्ताओं को उन अनुप्रयोगों के लिए अधिक सुसंगत डिज़ाइन दे सकता है जिन्हें एक छवि का वर्णन करने, एक छवि बनाने, उसकी व्याख्या करने और पाठ के साथ जारी रखने के बीच वैकल्पिक करने की आवश्यकता होती है।
कैश डिज़ाइन एक और संभावित उपयोगी योगदान है। Apple का कहना है कि टेक्स्ट और विज़ुअल आउटपुट पुन: एन्कोडिंग के बिना सीधे कुंजी-मूल्य कैश में प्रवेश कर सकते हैं। सिद्धांत रूप में, यह डुप्लिकेट प्रोसेसिंग को कम कर सकता है जब कोई सिस्टम तौर-तरीकों के बीच बार-बार चलता है, खासकर लंबी इंटरलीव्ड बातचीत या पीढ़ी के कार्यों में। हालाँकि, स्रोत प्रभाव की मात्रा निर्धारित नहीं करता है। विलंबता माप, मेमोरी आंकड़े, थ्रूपुट परिणाम, सेवा लागत या समकक्ष प्रसार-आधारित या टोकन सिस्टम के साथ तुलना की कोई रिपोर्ट नहीं की गई है। इसलिए दावा किए गए लाभ को एक स्थापित परिचालन लाभ के बजाय एक वास्तुशिल्प उद्देश्य और अनुसंधान दावे के रूप में माना जाना चाहिए।
प्रस्ताव इसलिए भी मायने रखता है क्योंकि यह उच्च-निष्ठा निरंतर छवि निर्माण को जोड़ते हुए एक पूर्व-प्रशिक्षित मॉडल की मल्टीमॉडल समझ को संरक्षित करने का प्रयास करता है। Apple का कहना है कि जमी हुई दृष्टि-भाषा धारा मौजूदा समझ को बनाए रखने में मदद करती है और प्रवाह धारा दृश्य निर्माण को सक्षम बनाती है। यह संयोजन भविष्य की प्रणालियों के लिए प्रासंगिक हो सकता है जिन्हें व्याख्या और निर्माण दोनों की आवश्यकता होती है, लेकिन स्रोत यह स्थापित नहीं करता है कि कितनी समझ संरक्षित है, दृश्य निष्ठा को कैसे मापा गया था या क्या एक कार्य पर लाभ दूसरे के प्रदर्शन के मुकाबले बदल जाता है। पेपर के परिणाम मल्टीमॉडल-मॉडल अनुसंधान के लिए महत्वपूर्ण हो सकते हैं, फिर भी उनका व्यापक महत्व घोषणा से अनुपस्थित विवरणों पर निर्भर करता है।
इंटरैक्टिव तंत्र: यह वास्तव में कैसे काम करता है
इस विकास के पीछे अंतर्निहित प्रौद्योगिकी का अंतःक्रियात्मक रूप से अन्वेषण करें।
Which component of an AI application is the machine-learning model itself?
आगे क्या देखना है
मुख्य अगला साक्ष्य पूर्ण प्रकाशन है, जिसमें बेंचमार्क विवरण, बेसलाइन, एब्लेशन, मॉडल आकार, गणना आवश्यकताएं और कोई कोड या वजन शामिल है। शोधकर्ताओं और डेवलपर्स को यह भी परीक्षण करना चाहिए कि क्या दावा किया गया केवी-कैश लाभ लंबे इंटरलीव्ड अनुक्रमों और वास्तविक मल्टीमॉडल वर्कफ़्लोज़ पर बना रहता है। Apple ने इस स्रोत में यह नहीं कहा है कि STARFlow2 एक उत्पाद, सार्वजनिक मॉडल या आम तौर पर उपलब्ध उपकरण है, और अगस्त 2026 के भीतर सटीक प्रकाशन तिथि प्रदान नहीं की गई है।
पहला सत्यापन बिंदु संपूर्ण पेपर और उसका प्रायोगिक रिकॉर्ड है। उपयोगी अनुवर्ती साक्ष्य में छवि-पीढ़ी और मल्टीमॉडल-समझ बेंचमार्क के नाम और संस्करण, STARFlow2 और प्रासंगिक बेसलाइन के लिए संख्यात्मक परिणाम, जमे हुए दृष्टि-भाषा स्ट्रीम, TARFlow स्ट्रीम, अवशिष्ट कनेक्शन और अव्यक्त-स्थान डिज़ाइन को अलग करने वाले एब्लेशन अध्ययन, और प्रशिक्षण डेटा, मॉडल आकार और गणना के बारे में विवरण शामिल होंगे। उन विवरणों के बिना, "मजबूत प्रदर्शन" यह स्थापित करने के लिए बहुत व्यापक है कि सुधार कितना बड़ा या विश्वसनीय है।
दूसरा सवाल यह है कि क्या प्रस्तावित कारण और कैश-अनुकूल संरचना रिपोर्ट किए गए परीक्षणों से परे काम करती है। स्वतंत्र शोधकर्ताओं को पाठ और छवियों के बीच बार-बार बदलाव वाले लंबे अनुक्रमों की जांच करने की आवश्यकता होगी, क्योंकि कैश वृद्धि, मेमोरी उपयोग और त्रुटि संचय व्यावहारिक प्रदर्शन को प्रभावित कर सकते हैं। उन्हें असतत छवि टोकन या पुनरावृत्त प्रसार का उपयोग करने वाले सिस्टम के मुकाबले आउटपुट गुणवत्ता, स्थिरता, नियंत्रणीयता और सेवा लागत की तुलना भी करनी चाहिए। स्रोत इन ट्रेड-ऑफ़ के बारे में अभी तक कोई सबूत नहीं देता है, न ही यह वितरण बदलाव या कठिन मल्टीमॉडल संकेतों के तहत व्यवहार की रिपोर्ट करता है।
अंतिम प्रश्न तैनाती है. स्रोत यह नहीं बताता है कि STARFlow2 Apple उत्पाद, एपीआई, अनुसंधान भंडार या डाउनलोड करने योग्य चेकपॉइंट के माध्यम से उपलब्ध है। यह सटीक प्रकाशन दिवस भी प्रदान नहीं करता है, इसलिए बताई गई 96-घंटे की समाचार विंडो के भीतर समय को आपूर्ति की गई सामग्री से कम नहीं किया जा सकता है। अनुवर्ती रिपोर्टिंग को यह स्थापित करना चाहिए कि क्या Apple कार्यान्वयन विवरण या मॉडल कलाकृतियाँ जारी करता है, क्या बाहरी समूह परिणामों को पुन: पेश कर सकते हैं, और क्या आर्किटेक्चर वाणिज्यिक मल्टीमॉडल सिस्टम को प्रभावित करता है। तब तक, सार्थक अज्ञात उपलब्धता, प्रतिलिपि प्रस्तुत करने योग्यता, संसाधन आवश्यकताएं और स्वतंत्र रूप से मापा गया लाभ हैं।