तकनीकी गाइड

ब्लॉक-विरल और मूल विरल ध्यान

ब्लॉक-विरल और देशी विरल ध्यान ट्रांसफार्मर को प्रत्येक टोकन के बजाय लंबे अनुक्रम के केवल सबसे प्रासंगिक हिस्सों पर ध्यान केंद्रित करने देता है, जिससे मानक ध्यान की द्विघात लागत कम हो जाती है।

2 मिनट लालअंतिम बार अद्यतन किया गया

सिंहावलोकन

This is what makes efficient long-context models practical on real hardware.

गहरा गोता

मानक आत्म-ध्यान प्रत्येक टोकन की तुलना हर दूसरे टोकन से करता है, इसलिए अनुक्रम लंबाई के साथ लागत चतुष्कोणीय रूप से बढ़ती है, जो बहुत लंबे दस्तावेज़ों के लिए निषेधात्मक हो जाती है। विरल ध्यान प्रत्येक टोकन को दूसरों के एक उपसमूह तक सीमित रखता है। ब्लॉक-स्पार्स दृष्टिकोण अनुक्रम को ब्लॉक में विभाजित करते हैं और केवल चयनित ब्लॉक जोड़े के लिए ध्यान की गणना करते हैं, जो जीपीयू टेंसर कोर पर कुशलतापूर्वक मैप करता है। डीपसीक से नेटिव स्पार्स अटेंशन (एनएसए) आगे बढ़ता है: यह प्रशिक्षण योग्य एंड-टू-एंड और हार्डवेयर-संरेखित है, जिसमें तीन शाखाएं, मोटे-दानेदार टोकन संपीड़न, सबसे महत्वपूर्ण ब्लॉकों का बारीक-बारीक चयन और स्थानीय संदर्भ के लिए एक स्लाइडिंग विंडो शामिल है। क्योंकि स्पार्सिटी पैटर्न को बाद में लागू करने के बजाय प्रीट्रेनिंग के दौरान सीखा जाता है, एनएसए लंबे अनुक्रमों पर बड़े स्पीडअप प्रदान करते समय सटीकता को बरकरार रखता है।

तकनीकी अंतर्दृष्टि

एनएसए तीन समानांतर पथों के माध्यम से कुंजियों और मूल्यों को संसाधित करता है, फिर उन्हें सीखे गए गेटों के साथ विलय कर देता है। संपीड़न टोकन के ब्लॉक को सारांश अभ्यावेदन में एकत्रित करता है; चयन स्कोर ब्लॉक करता है और केवल शीर्ष क्रम वाले लोगों को ही पूर्ण ध्यान के लिए रखता है; एक स्लाइडिंग विंडो पास के टोकन को कवर करती है। ब्लॉक-स्तरीय संचालन जीपीयू मेमोरी एक्सेस और टेंसर-कोर थ्रूपुट के साथ संरेखित होते हैं, इसलिए सैद्धांतिक एफएलओपी बचत प्रशिक्षण और अनुमान दोनों के दौरान वास्तविक वॉल-क्लॉक स्पीडअप में तब्दील हो जाती है, खासकर मेमोरी-बाउंड डिकोडिंग चरण के लिए।

सामरिक प्रभाव

लागत और बजट

वास्तुकला संबंधी निर्णय वर्षों तक प्रदर्शन और परिचालन लागत को संचालित करते हैं।

स्पष्ट निर्णय

तकनीकी शिक्षा टीमों को सही स्टैक चुनने में मदद करती है, न कि केवल नवीनतम स्टैक चुनने में।

गुणवत्ता नियंत्रण

बेहतर इंजीनियरिंग विकल्प उत्पादन में विश्वसनीयता की घटनाओं को कम करते हैं।

ब्लॉक-विरल और मूल विरल ध्यान का भविष्य

प्रशिक्षण योग्य, हार्डवेयर-जागरूक स्पार्सिटी विस्फोट लागत के बिना मिलियन-टोकन संदर्भ का मार्ग बन रही है। उम्मीद है कि कम ध्यान को कर्नेल और एक्सेलेरेटर के साथ सह-डिज़ाइन किया जाएगा, रैखिक-ध्यान और राज्य-अंतरिक्ष विचारों के साथ मिश्रित किया जाएगा, और सीमांत लंबे-संदर्भ और तर्क मॉडल में अपनाया जाएगा। जैसे-जैसे पैटर्न सीखने योग्य और गतिशील हो जाते हैं, मॉडल प्रति प्रश्न अनुकूल रूप से ध्यान बजट आवंटित करेंगे, और बेंचमार्क केवल कच्ची गुणवत्ता ही नहीं, बल्कि लंबे अनुक्रमों पर डिकोडिंग थ्रूपुट को तेजी से मापेंगे।

वास्तविक विश्व कार्यान्वयन

पूरे कोडबेस या लंबे कानूनी अनुबंध पर एक मॉडल चलाना जहां पूरा ध्यान जीपीयू मेमोरी को समाप्त कर देगा।

डीपसीक का एनएसए पूर्ण-ध्यान सटीकता का मिलान या पिटाई करते हुए प्रीट्रेनिंग और लंबे-संदर्भ अनुमान दोनों को तेज कर रहा है।

संपीड़ित ब्लॉक सारांश और स्थानीय रूप से प्रासंगिक अंशों पर ध्यान देकर पुस्तक-लंबाई वाले दस्तावेज़ों का सारांश बनाना।

प्रत्येक टोकन को शीर्ष-रैंक वाले ब्लॉक तक सीमित करके लंबे-संदर्भ वाले चैट सहायकों को तेज़ करना, जिनके डिकोडिंग चरण मेमोरी-बाउंड हैं।

जोखिम और रेलिंग

एक बेंचमार्क को अनुकूलित करने से व्यापक सिस्टम कमजोरियों को छुपाया जा सकता है।

बुनियादी ढांचे और रखरखाव की लागत को अक्सर कम करके आंका जाता है।

जैसे-जैसे सिस्टम अधिक जटिल होते जाएंगे सुरक्षा और अवलोकन संबंधी अंतराल बढ़ सकते हैं।

कार्यान्वयन रोडमैप

1

कार्यान्वयन से पहले विलंबता, गुणवत्ता और लागत लक्ष्य परिभाषित करें।

2

यथार्थवादी लोड और डेटा स्थितियों के तहत बेंचमार्क।

3

त्रुटियों, बहाव और उपयोगकर्ता प्रभाव के लिए उपकरण निगरानी।

4

स्केलिंग से पहले रोलबैक और घटना प्रतिक्रिया पथ तैयार करें।

अन्वेषण करते रहें

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Block-Sparse and Native Sparse Attention quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

प्रश्नोत्तरी प्रारंभ करें

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

अक्सर पूछे जाने वाले प्रश्नों

What is Block-Sparse and Native Sparse Attention?

ब्लॉक-विरल और देशी विरल ध्यान ट्रांसफार्मर को प्रत्येक टोकन के बजाय लंबे अनुक्रम के केवल सबसे प्रासंगिक हिस्सों पर ध्यान केंद्रित करने देता है, जिससे मानक ध्यान की द्विघात लागत कम हो जाती है। यही वह चीज़ है जो कुशल लंबे-संदर्भ मॉडल को वास्तविक हार्डवेयर पर व्यावहारिक बनाती है।

लंबे अनुक्रमों के लिए मानक आत्म-ध्यान महंगा क्यों है?

प्रत्येक टोकन हर दूसरे टोकन पर ध्यान देता है, इसलिए अनुक्रम लंबाई के वर्ग के साथ गणना और मेमोरी स्केल करें।

ब्लॉक-विरल ध्यान का मूल विचार क्या है?

अनुक्रम को ब्लॉकों में विभाजित किया गया है और ध्यान की गणना केवल चुने हुए ब्लॉक जोड़े के लिए की जाती है, जो जीपीयू टेंसर कोर पर भी अच्छी तरह से मैप होता है।

क्या नेटिव स्पार्स अटेंशन (एनएसए) को पहले के कई स्पार्स तरीकों से अलग बनाता है?

एनएसए प्रीट्रेनिंग के दौरान अपने स्पार्सिटी पैटर्न को सीखता है और इसे हार्डवेयर के साथ संरेखित करने के लिए डिज़ाइन किया गया है, इसलिए यह तेजी से दौड़ते समय सटीकता बनाए रखता है।

एनएसए अपनी कुंजियों और मूल्यों के लिए किन तीन शाखाओं को संयोजित करता है?

एनएसए सीखे गए गेटों का उपयोग करके मोटे टोकन संपीड़न, बारीक-बारीक ब्लॉक चयन और एक स्थानीय स्लाइडिंग विंडो का विलय करता है।

एनएसए मनमाने ढंग से टोकन-स्तरीय विरलता के बजाय ब्लॉक-स्तरीय संचालन का उपयोग क्यों करता है?

ब्लॉक-स्तरीय एक्सेस पैटर्न GPU हार्डवेयर के अनुरूप होते हैं, इसलिए सैद्धांतिक FLOP बचत वास्तविक वॉल-क्लॉक स्पीडअप बन जाती है।