तकनीकी गाइड

स्मूथक्वांट और एक्टिवेशन क्वांटाइजेशन

स्मूथक्वांट एक ऐसी तकनीक है जो बड़े भाषा मॉडल को बिना दोबारा प्रशिक्षण के वजन और सक्रियण दोनों के लिए 8-बिट पूर्णांक तक संपीड़ित करना संभव बनाती है।

2 मिनट लालअंतिम बार अद्यतन किया गया

सिंहावलोकन

It matters because activations in big models contain extreme outliers that normally wreck low-precision math, and SmoothQuant tames them.

गहरा गोता

जब आप किसी मॉडल को 16-बिट फ़्लोट से 8-बिट पूर्णांक तक सिकोड़ते हैं, तो वज़न आसानी से संपीड़ित हो जाता है, लेकिन सक्रियण में परेशानी होती है: कुछ चैनल बाकी की तुलना में 10 से 100 गुना बड़े मान रखते हैं, और उन्हें एक मोटे पूर्णांक ग्रिड में मजबूर करने से सटीकता नष्ट हो जाती है। स्मूथक्वांट, जिओ एट अल द्वारा प्रस्तुत किया गया। 2022 में, यह देखा गया कि वजन सहज और परिमाणित करने में आसान है जबकि सक्रियताएँ कांटेदार हैं। तो यह गणितीय रूप से कठिनाई को स्थानांतरित करता है: यह सक्रियण चैनलों को प्रति-चैनल पैमाने से विभाजित करता है और संबंधित वजन को उसी पैमाने से गुणा करता है। दो ऑपरेशन रद्द हो जाते हैं, जिससे मॉडल आउटपुट अपरिवर्तित रहता है, लेकिन अब दोनों टेंसर अनुकूल रेंज में बैठते हैं। परिणाम लगभग शून्य सटीकता हानि और लगभग 2x स्पीडअप और मेमोरी बचत के साथ W8A8 (8-बिट वजन और सक्रियण) अनुमान है।

तकनीकी अंतर्दृष्टि

मुख्य चाल एक प्रति-चैनल स्मूथिंग कारक है जिसकी गणना s = max(|X|)^alpha / max(|W|)^(1-alpha) के रूप में की जाती है। सक्रियणों को 1/s द्वारा और भार को s द्वारा बढ़ाया जाता है, इसलिए मैट्रिक्स उत्पाद XW संरक्षित रहता है। क्योंकि स्केलिंग को पिछली परत के वजन या फ़्यूज्ड ऑपरेशन में ऑफ़लाइन अवशोषित किया जाता है, यह शून्य रनटाइम लागत जोड़ता है। अल्फ़ा हाइपरपैरामीटर (अक्सर 0.5) नियंत्रित करता है कि सक्रियण से वज़न पर कितना बाहरी बोझ स्थानांतरित होता है।

सामरिक प्रभाव

लागत और बजट

वास्तुकला संबंधी निर्णय वर्षों तक प्रदर्शन और परिचालन लागत को संचालित करते हैं।

स्पष्ट निर्णय

तकनीकी शिक्षा टीमों को सही स्टैक चुनने में मदद करती है, न कि केवल नवीनतम स्टैक चुनने में।

गुणवत्ता नियंत्रण

बेहतर इंजीनियरिंग विकल्प उत्पादन में विश्वसनीयता की घटनाओं को कम करते हैं।

स्मूथक्वांट और एक्टिवेशन क्वांटाइजेशन का भविष्य

स्मूथक्वांट ने स्थापित किया कि सक्रियण आउटलेर्स अपरिहार्य के बजाय माइग्रेट करने योग्य हैं, और यह विचार अब INT8 और FP8 सेवा के उत्पादन को रेखांकित करता है। अपेक्षा करें कि स्मूथिंग को प्रति-समूह परिमाणीकरण, सीखी गई स्केलिंग और 4-बिट सक्रियण अनुसंधान (उदाहरण के लिए बाहरी-जागरूक तरीकों) जैसी बेहतर योजनाओं के साथ जोड़ा जाएगा। जैसे-जैसे FP8 हार्डवेयर (हॉपर, ब्लैकवेल) परिपक्व होता है, स्मूथिंग-स्टाइल बैलेंसिंग को कंपाइलर और अनुमान-इंजन पाइपलाइनों में बेक किया जाता रहेगा ताकि परिमाणीकरण लगभग मुक्त रहे।

वास्तविक विश्व कार्यान्वयन

मेमोरी और मैट्रिक्स-गुणा लागत दोनों को आधा करके कम GPU पर W8A8 पर 70B-पैरामीटर LLM की सेवा प्रदान करना

NVIDIA हॉपर/ब्लैकवेल टेंसर कोर पर INT8 अनुमान को सक्षम करना जो मूल रूप से 8-बिट पूर्णांक गणित को तेज करता है

लागत-बाधित क्लाउड एंडपॉइंट पर चैट मॉडल तैनात करना जहां थ्रूपुट को दोगुना करने से प्रति टोकन बिल में सीधे कटौती होती है

ऑन-डिवाइस भाषण या अनुवाद के लिए ट्रांसफॉर्मर एनकोडर को संपीड़ित करना जहां 8-बिट कर्नेल तेजी से और कूलर चलते हैं

जोखिम और रेलिंग

एक बेंचमार्क को अनुकूलित करने से व्यापक सिस्टम कमजोरियों को छुपाया जा सकता है।

बुनियादी ढांचे और रखरखाव की लागत को अक्सर कम करके आंका जाता है।

जैसे-जैसे सिस्टम अधिक जटिल होते जाएंगे सुरक्षा और अवलोकन संबंधी अंतराल बढ़ सकते हैं।

कार्यान्वयन रोडमैप

1

कार्यान्वयन से पहले विलंबता, गुणवत्ता और लागत लक्ष्य परिभाषित करें।

2

यथार्थवादी लोड और डेटा स्थितियों के तहत बेंचमार्क।

3

त्रुटियों, बहाव और उपयोगकर्ता प्रभाव के लिए उपकरण निगरानी।

4

स्केलिंग से पहले रोलबैक और घटना प्रतिक्रिया पथ तैयार करें।

अन्वेषण करते रहें

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the SmoothQuant and Activation Quantization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

प्रश्नोत्तरी प्रारंभ करें

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

अगली गाइड

सक्रियण संचालन और प्रतिनिधित्व इंजीनियरिंग

अक्सर पूछे जाने वाले प्रश्नों

What is SmoothQuant and Activation Quantization?

स्मूथक्वांट एक ऐसी तकनीक है जो बड़े भाषा मॉडल को बिना दोबारा प्रशिक्षण के वजन और सक्रियण दोनों के लिए 8-बिट पूर्णांक तक संपीड़ित करना संभव बनाती है। यह मायने रखता है क्योंकि बड़े मॉडलों में सक्रियणों में अत्यधिक आउटलेयर होते हैं जो आम तौर पर कम-सटीक गणित को बर्बाद कर देते हैं, और स्मूथक्वांट उन्हें नियंत्रित करता है।

स्मूथक्वांट विशेष रूप से कम-परिशुद्धता अनुमान में किस समस्या का समाधान करता है?

स्मूथक्वांट कुछ सक्रियण चैनलों में दिखाई देने वाले बड़े बाहरी मूल्यों को लक्षित करता है, जो अन्यथा सटीकता को नष्ट कर देता है जब सक्रियण को 8 बिट्स तक परिमाणित किया जाता है।

स्मूथक्वांट सक्रियणों को परिमाणित करना कैसे आसान बनाता है?

यह सक्रियण चैनलों को प्रति-चैनल पैमाने से विभाजित करता है और मिलान भार को उस पैमाने से गुणा करता है, इसलिए उत्पाद अपरिवर्तित रहता है लेकिन दोनों टेंसरों को परिमाणित करना आसान हो जाता है।

नोटेशन W8A8 का क्या मतलब है?

W8A8 भार (W) और सक्रियण (A) दोनों के लिए 8-बिट परिमाणीकरण को दर्शाता है, स्मूथक्वांट न्यूनतम सटीकता हानि के साथ सक्षम बनाता है।

स्मूथक्वांट की स्केलिंग अनिवार्य रूप से कोई रनटाइम ओवरहेड क्यों नहीं जोड़ती है?

स्मूथिंग स्केल को समय से पहले पूर्ववर्ती परत के वजन या फ़्यूज्ड ऑप में मोड़ दिया जाता है, इसलिए अनुमान के समय कोई अतिरिक्त गणना नहीं होती है।

स्मूथक्वांट में अल्फा हाइपरपैरामीटर क्या भूमिका निभाता है?

अल्फा (आमतौर पर 0.5) स्मूथिंग फैक्टर को संतुलित करता है, यह तय करता है कि परिमाणीकरण की कितनी कठिनाई सक्रियणों से हटकर वजन पर आती है।