समाचार पर वापस जाएँ
नवीनताAI Understanding ब्रीफिंग

TASSO पेपर निरंतर सीखने के दौरान दृष्टि-भाषा मॉडल कौशल को संरक्षित करने का प्रस्ताव करता है

एक arXiv पेपर TASSO का परिचय देता है, जो पहले की क्षमताओं और शून्य-शॉट प्रदर्शन के नुकसान को कम करते हुए नए कार्यों के लिए दृष्टि-भाषा मॉडल को अनुकूलित करने की एक विधि है। लेखक सीएलआईपी-आधारित निरंतर-सीखने के बेंचमार्क में मौजूदा तरीकों में सुधार की रिपोर्ट करते हैं, लेकिन स्रोत कोई संख्यात्मक परिणाम प्रदान नहीं करता है।

6 min readRead the primary source
Primary-source image accompanying TASSO paper proposes preserving vision-language model skills during continual learning
प्राथमिक-स्रोत दस्तावेज़स्रोत रिकार्ड किया गया
प्रकाशक
arxiv.org
स्रोत लिंक
arxiv.orghttps://arxiv.org/abs/2608.21487
स्रोत प्रकार
प्राथमिक दस्तावेज़ - एक आधिकारिक घोषणा, कागज, फाइलिंग, या प्रथम-पक्ष पृष्ठ जिसे हम सीधे पढ़ते हैं।
प्रसंगइसे 60 सेकंड में समझें

यहां से प्रारंभ करें

प्रमुख शर्तें

दृष्टि-भाषा मॉडल (वीएलएम)
एक मल्टीमॉडल मॉडल जो दृश्य और पाठ्य सूचना को संयुक्त रूप से संसाधित करता है।
सतत सीखना
प्रशिक्षण दृष्टिकोण जो एक मॉडल को पूर्व ज्ञान को भूले बिना नए डेटा से सीखते रहने देते हैं।
पैरामीटर-कुशल फ़ाइन-ट्यूनिंग (PEFT)
वे विधियाँ जो अतिरिक्त मापदंडों के एक छोटे उपसमूह को प्रशिक्षित करके मॉडल को अनुकूलित करती हैं।
स्वयं की जांच करोएआई मॉडल समझाए गए प्रश्नोत्तरी

क्या हुआ?

शोधकर्ताओं ने TASSO की शुरुआत की, जो दृष्टि-भाषा मॉडल के लिए एक सतत-सीखने की विधि है जो कार्य-विशिष्ट निम्न-रैंक उप-स्थानों को ज्यामिति-जागरूक ज्ञान आसवन के साथ जोड़ती है। मल्टी-डोमेन टास्क-इंक्रीमेंटल और क्लास-इंक्रीमेंटल बेंचमार्क पर सीएलआईपी का उपयोग करने वाले प्रयोगों में, पेपर रिपोर्ट में विनाशकारी भूलने के प्रतिरोध में सुधार हुआ और शून्य-शॉट क्षमताओं में गिरावट कम हुई।

स्रोत 21 अगस्त, 2026 को प्रस्तुत एक पेपर के लिए एक arXiv सूची है। पेपर दृष्टि-भाषा मॉडल में निरंतर सीखने को संबोधित करता है, जो सिस्टम हैं जो दृश्य और भाषा प्रतिनिधित्व को जोड़ते हैं। इसकी बताई गई समस्या यह है कि निरंतर अनुकूलन दो संबंधित विफलताएं उत्पन्न कर सकता है: पहले सीखे गए कार्यों की भयावह भूल और शून्य-शॉट प्रदर्शन में गिरावट। स्रोत इन्हें कार्य के लिए प्रेरणा के रूप में प्रस्तुत करता है, न कि किसी नई बाहरी तैनाती या उत्पाद रिलीज़ के परिणाम के रूप में।

लेखक अपने प्रस्तावित दृष्टिकोण को TASSO कहते हैं, जो विज़न-लैंग्वेज मॉडल के निरंतर सीखने के लिए टास्क-स्पेसिफिक सबस्पेस ऑप्टिमाइज़ेशन का संक्षिप्त रूप है। विधि में दो बताए गए घटक हैं। सबसे पहले, यह कार्य-विशिष्ट निम्न-रैंक प्रोजेक्टरों का अनुक्रम सीखता है और क्रॉस-एन्ट्रॉपी को अनुकूलित करने से पहले अव्यक्त अभ्यावेदन को प्रोजेक्ट करने के लिए उनका उपयोग करता है। दूसरा, यह अपने अव्यक्त स्थान की ज्यामिति को संरक्षित करते हुए पिछले कार्य पर प्रशिक्षित मॉडल से ज्ञान प्राप्त करने के लिए जियोडेसिक-दूरी-आधारित हानि को लागू करता है। ये विवरण पेपर के सार से आते हैं; स्रोत एल्गोरिथम या उसके प्रशिक्षण कार्यक्रम के पुनर्निर्माण के लिए पर्याप्त विवरण प्रदान नहीं करता है।

पेपर का केंद्रीय डिज़ाइन दावा यह है कि केवल कार्य-प्रासंगिक उप-स्थानों को अद्यतन करने से पूर्ण एम्बेडिंग आयामों में अनावश्यक परिवर्तनों से बचा जा सकता है, जबकि ज्यामिति-जागरूक आसवन अद्यतन को नियमित करता है। सार में, लेखकों का कहना है कि यह संयोजन मॉडल के अव्यक्त अभ्यावेदन की संरचना को बनाए रखते हुए नेटवर्क प्लास्टिसिटी को संरक्षित करता है। यहां "प्लास्टिसिटी" का तात्पर्य नए कार्यों को सीखने की क्षमता से है; स्रोत इसके लिए एक सार्वभौमिक उपाय को परिभाषित नहीं करता है या यह स्थापित नहीं करता है कि विधि सामान्य निरंतर-सीखने की समस्या का समाधान करती है।

मूल्यांकन के लिए, स्रोत का कहना है कि लेखकों ने मल्टी-डोमेन कार्य-वृद्धिशील और कक्षा-वृद्धिशील शिक्षण बेंचमार्क पर सीएलआईपी विज़न-भाषा मॉडल का उपयोग किया। पेपर भूलने की समस्या को कम करने और शून्य-शॉट क्षमताओं को संरक्षित करने में अत्याधुनिक तरीकों में स्पष्ट सुधार की रिपोर्ट करता है। सार प्रतिस्पर्धी तरीकों का नाम नहीं देता है, डेटासेट की पहचान नहीं करता है, स्कोर प्रदान नहीं करता है, कार्यों की संख्या या क्रम नहीं बताता है, सांख्यिकीय भिन्नता की रिपोर्ट नहीं करता है, या यह नहीं बताता है कि तुलना में समान प्रशिक्षण बजट का उपयोग किया गया है या नहीं। इसमें यह भी नहीं बताया गया है कि कार्यान्वयन कोड या प्रशिक्षित मॉडल उपलब्ध हैं या नहीं।

स्रोत विवरण: arxiv.org ↗

यह क्यों मायने रखता है?

विज़न-भाषा मॉडल आंशिक रूप से उपयोगी होते हैं क्योंकि वे ऐसे कार्य कर सकते हैं जिनके लिए उन्हें स्पष्ट रूप से प्रशिक्षित नहीं किया गया था। यदि किसी को नए कार्यों में ढालने से पहले की क्षमताओं या उसके शून्य-शॉट व्यवहार को नुकसान पहुंचता है, तो प्रत्येक अपडेट मॉडल की व्यापक उपयोगिता को कम कर सकता है। TASSO का लक्ष्य मॉडल-प्रशिक्षण स्तर पर व्यापार-बंद करना है, हालांकि स्रोत यह स्थापित नहीं करता है कि लाभ कितने बड़े हैं या क्या वे रिपोर्ट किए गए बेंचमार्क से परे स्थानांतरित होते हैं।

व्यावहारिक मुद्दा महत्वपूर्ण है क्योंकि बदलते कार्यों या डोमेन के संपर्क में आने वाले एआई सिस्टम के लिए निरंतर अनुकूलन एक सामान्य आवश्यकता है। किसी मॉडल को पहले वाली क्षमता को त्यागे बिना नई क्षमता प्राप्त करने की आवश्यकता हो सकती है। एक दृष्टि-भाषा मॉडल के लिए, जिसमें अधिक विशिष्ट कार्यों के अनुक्रम से सीखते हुए व्यापक शून्य-शॉट व्यवहार को बनाए रखना शामिल हो सकता है। पेपर केवल एआई को एक आकस्मिक उपकरण के रूप में उपयोग करने के बजाय सीधे उस मॉडल-प्रबंधन समस्या का अध्ययन करता है। TASSO का रिपोर्ट किया गया दृष्टिकोण शोधकर्ताओं और इंजीनियरों के लिए मायने रख सकता है यदि इसका लाभ यथार्थवादी अद्यतन स्थितियों के तहत रहता है।

एक विधि जो अद्यतनों को कार्य-विशिष्ट उप-स्थानों तक सीमित करती है, सिद्धांत रूप में, कार्यों के बीच हस्तक्षेप को कम कर सकती है और बार-बार अनुकूलन को अधिक प्रबंधनीय बना सकती है। हालाँकि, स्रोत प्रशिक्षण समय, मेमोरी उपयोग, पैरामीटर गणना, अनुमान ओवरहेड, या प्रोजेक्टर अनुक्रम हर नए कार्य के साथ बढ़ता है या नहीं, इसकी रिपोर्ट नहीं करता है। वे चूक इसकी परिचालन लागत के जमीनी मूल्यांकन को रोकती हैं। पेपर अव्यक्त-अंतरिक्ष ज्यामिति पर भी ध्यान केंद्रित करता है, जिससे परिणाम को एक बेंचमार्क स्कोर से परे व्यापक शोध रुचि मिलती है।

इसका दावा है कि सीखे गए प्रतिनिधित्व के भीतर संबंधों को संरक्षित करने से नए सीखने के लिए पर्याप्त लचीलापन छोड़ते हुए पूर्व ज्ञान को बनाए रखने में मदद मिल सकती है। यदि मान्य किया जाता है, तो यह मल्टीमॉडल मॉडल में स्थिरता-प्लास्टिसिटी व्यापार-बंद के बारे में सोचने का एक संभावित तरीका प्रदान करेगा। स्रोत यह नहीं दिखाता है कि प्रस्तावित ज्यामिति प्रत्येक मॉडल परिवार के लिए सार्थक है या इसे संरक्षित करना आवश्यक रूप से वास्तविक अनुप्रयोगों में विश्वसनीय व्यवहार से संबंधित है। रिपोर्ट किया गया मूल्यांकन प्रासंगिक है लेकिन केवल स्रोत से जो निष्कर्ष निकाला जा सकता है वह सीमित है।

सीएलआईपी एक नामित परीक्षण मॉडल है, और बेंचमार्क को मल्टी-डोमेन कार्य-वृद्धिशील और वर्ग-वृद्धिशील सेटिंग्स के रूप में वर्णित किया गया है। वे सेटिंग्स यह बता सकती हैं कि कार्यों के जमा होने पर प्रदर्शन बदलता है या नहीं, लेकिन सार यह स्थापित नहीं करता है कि वे उत्पादन अपडेट, उपयोगकर्ता की बदलती जरूरतों, नई भाषाओं, छवि वितरण, या सुरक्षा-संवेदनशील उपयोग का कितनी बारीकी से प्रतिनिधित्व करते हैं। न ही यह TASSO की तुलना अत्याधुनिक तरीकों के बारे में सामान्य कथन से परे रीट्रेनिंग, रीप्ले, पैरामीटर-कुशल फाइन-ट्यूनिंग या अन्य अपडेट रणनीतियों से करता है। इसलिए परिणाम का मुख्य सार्वजनिक मूल्य तत्काल उपभोक्ता प्रभाव के बजाय पद्धतिगत है। यह एआई मॉडल अपडेट में ज्ञात विफलता मोड को कम करने के लिए एक ठोस प्रस्ताव प्रस्तुत करता है। यह किसी जारी किए गए उत्पाद, किसी तैनात प्रणाली, नैदानिक ​​या वाणिज्यिक परिणाम या सबूत की घोषणा नहीं करता है कि उपयोगकर्ता अब बेहतर प्रदर्शन देखेंगे। काम को जांच के इंतजार में एक शोध दावे के रूप में पढ़ा जाना चाहिए, न कि सबूत के रूप में कि दृष्टि-भाषा मॉडल के निरंतर अनुकूलन का समाधान हो गया है।

Interactive Mechanism

इंटरैक्टिव तंत्र: यह वास्तव में कैसे काम करता है

इस विकास के पीछे अंतर्निहित प्रौद्योगिकी का अंतःक्रियात्मक रूप से अन्वेषण करें।

Document Size:128K tokens
Needle Placement Depth (Location in document):50% into text
Attention Context Buffer Map:
Target Fact (50%)
Equivalent Pages~320Standard book pages
Retrieval Accuracy99.9%Needle recall score
RAM / KV Cache5.1 GBMemory overhead
Prompt CachingActive~80% discount on reuse
Core takeaway: Million-token context windows allow querying whole codebases or legal archives in one prompt. However, KV cache memory scales with context length, making prompt caching crucial for real-time production.
इंटरएक्टिव कॉन्सेप्ट चेक+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

आगे क्या देखना है

पूरे पेपर को संख्यात्मक तुलनाओं, आधारभूत चयन, गणना और स्मृति आवश्यकताओं, पृथक्करण अध्ययन और विभिन्न दृष्टि-भाषा मॉडल और कार्य अनुक्रमों में प्रदर्शन के लिए जांचा जाना चाहिए। स्वतंत्र प्रतिकृति भी महत्वपूर्ण होगी क्योंकि स्रोत एक संस्करण-एक arXiv प्रीप्रिंट है और सार बेंचमार्क सेटिंग्स के बाहर तैनाती, कोड उपलब्धता या मूल्यांकन का वर्णन नहीं करता है।

पहली सत्यापन प्राथमिकता पेपर का मात्रात्मक साक्ष्य है। सार कहता है कि TASSO "स्पष्ट सुधार" प्रदान करता है, लेकिन कोई मूल्य नहीं देता है। सावधानीपूर्वक समीक्षा में प्रत्येक कार्य अनुक्रम में भूलने और शून्य-शॉट गिरावट की तुलना करनी चाहिए, पूर्ण और साथ ही सापेक्ष लाभ का निरीक्षण करना चाहिए, और यह निर्धारित करना चाहिए कि सुधार डोमेन और वर्ग-वृद्धिशील सेटिंग्स में सुसंगत हैं या नहीं। जो परिणाम केवल चयनित कार्यों पर दिखाई देते हैं या किसी विशेष कार्य क्रम पर निर्भर करते हैं, वे दावे को सीमित कर देंगे।

अगला मुद्दा आधारभूत निष्पक्षता का है। पूरे पेपर में तुलना के लिए उपयोग की जाने वाली अत्याधुनिक विधियों की पहचान होनी चाहिए और यह दिखाना चाहिए कि क्या सभी विधियों को तुलनीय डेटा, अनुकूलन चरण, मॉडल आरंभीकरण और गणना प्राप्त हुई है। एब्लेशन परीक्षणों को निम्न-रैंक उप-स्थान सीखने के योगदान को जियोडेसिक-दूरी आसवन हानि से अलग करना चाहिए। उन परीक्षणों के बिना, यह जानना मुश्किल होगा कि परिणाम प्रस्तावित संयोजन, एक घटक, या प्रशिक्षण स्थितियों में अंतर से आता है।

संसाधन आवश्यकताओं पर भी ध्यान देने की आवश्यकता है। सूत्र का कहना है कि TASSO कार्य-विशिष्ट प्रोजेक्टरों का एक क्रम सीखता है, लेकिन यह नहीं बताता है कि वे प्रोजेक्टर कितने पैरामीटर जोड़ते हैं, क्या भंडारण कार्यों की संख्या के साथ बढ़ता है, या क्या अनुमान को कार्य-विशिष्ट संरचनाओं के बीच चयन करना होगा। वे विवरण प्रभावित करते हैं कि क्या विधि लंबे कार्य अनुक्रमों के लिए व्यावहारिक है। पेपर को यह भी स्पष्ट करना चाहिए कि जब कार्य सीमाएँ अस्पष्ट होती हैं, डोमेन ओवरलैप होते हैं, या नया डेटा बेंचमार्क वितरण से काफी भिन्न होता है तो TASSO कैसे व्यवहार करता है।

सामान्यीकरण एक और खुला प्रश्न है। स्रोत का नाम CLIP है, लेकिन अन्य दृष्टि-भाषा मॉडल, मॉडल आकार, तौर-तरीके या प्रशिक्षण व्यवस्था की पहचान नहीं करता है। स्वतंत्र कार्य को यह परीक्षण करना चाहिए कि क्या विधि आर्किटेक्चर में स्थानांतरित होती है और क्या यह उन क्षमताओं को संरक्षित करती है जो निरंतर-सीखने के बेंचमार्क में प्रस्तुत नहीं की गई थीं। मूल्यांकन में कार्य क्रम और वितरण बदलाव की मजबूती शामिल होनी चाहिए, क्योंकि एक निश्चित अनुक्रम के लिए काम करने वाली विधि वास्तविक दुनिया के बदलते डेटा के तहत समान सुरक्षा प्रदान नहीं कर सकती है।

अंत में, पाठकों को संशोधन, कोड, प्रशिक्षित चौकियों और स्वतंत्र प्रतिकृतियों पर ध्यान देना चाहिए। सूची पेपर को संस्करण एक के रूप में पहचानती है, और आपूर्ति किए गए स्रोत में पेपर के पूर्ण प्रयोगात्मक साक्ष्य के बजाय केवल सार और ग्रंथ सूची पृष्ठ शामिल है। महत्वपूर्ण अज्ञात में सटीक डेटासेट और मेट्रिक्स, संख्यात्मक प्रभाव आकार, गणना लागत, विफलता के मामले, कोड उपलब्धता, और क्या लेखकों द्वारा रिपोर्ट किए गए सुधार व्यापक परीक्षण के बाद भी बने हुए हैं, शामिल हैं।

संबंधित मार्गदर्शिकाएँ एवं प्रश्नोत्तरी

एआई मॉडल की व्याख्याएआई प्रशिक्षणट्रांसफार्मरआप जो जानते हैं उसका परीक्षण करें - निःशुल्क AI प्रश्नोत्तरी आज़माएँहमारी शब्दावली में एआई शब्द देखेंएआई मॉडल रिलीज ट्रैकर का पालन करें
क्या यह उपयोगी पाया गया?