तकनीकी गाइड

GPTQ और AWQ प्रशिक्षण उपरांत परिमाणीकरण

GPTQ और AWQ पहले से प्रशिक्षित भाषा मॉडल को 4-बिट परिशुद्धता तक सिकोड़ने की दो प्रमुख विधियाँ हैं ताकि वे सस्ते, छोटे हार्डवेयर पर चलें।

2 मिनट लालअंतिम बार अद्यतन किया गया

सिंहावलोकन

They are why you can run a capable model on a single consumer GPU instead of a datacenter rack.

गहरा गोता

पोस्ट-ट्रेनिंग क्वांटाइजेशन (पीटीक्यू) एक तैयार मॉडल को दोबारा प्रशिक्षित किए बिना संपीड़ित करता है, मेमोरी को लगभग चौथाई करने के लिए उच्च-सटीक वजन को 4 बिट तक मैप करता है। चुनौती सटीकता को नष्ट किए बिना ऐसा करने की है। जीपीटीक्यू (ओबीक्यू का परिशोधन) शेष वजन को समायोजित करने और प्रत्येक गोलाई त्रुटि की भरपाई के लिए एक छोटे अंशांकन डेटासेट से दूसरे क्रम की जानकारी का उपयोग करके परत दर परत वजन की मात्रा निर्धारित करता है। AWQ (एक्टिवेशन-अवेयर वेट क्वांटाइजेशन) एक अलग दृष्टिकोण लेता है: यह देखता है कि वजन चैनलों का एक छोटा सा अंश असंगत रूप से महत्वपूर्ण है, सक्रियण परिमाण को देखकर पहचाना जाता है, और उन प्रमुख चैनलों को आक्रामक तरीके से मात्रा निर्धारित करने के बजाय स्केल करके उनकी रक्षा करता है। दोनों ने लामा जैसे मॉडल को 4-बिट में चलने दिया, और वीएलएलएम, लामा.सीपीपी और ऑटोजीपीटीक्यू जैसे टूल ने उन्हें स्थानीय और लागत-कुशल अनुमान के लिए मुख्यधारा बना दिया है।

तकनीकी अंतर्दृष्टि

जीपीटीक्यू हेसियन (नुकसान की वक्रता) के एक अनुमान का उपयोग यह तय करने के लिए करता है कि एक वजन को गोल करने से दूसरे को कैसे प्रभावित करना चाहिए, जिससे उत्पन्न त्रुटि कम से कम हो। AWQ हेसियन्स को पूरी तरह से छोड़ देता है: यह प्रति-चैनल स्केलिंग कारक की गणना करता है ताकि महत्वपूर्ण वजन चैनल अपनी प्रभावी सटीकता बनाए रखें, फिर समान रूप से मात्रा निर्धारित करें। दोनों सक्रियता को उच्च परिशुद्धता में रखते हैं और केवल वजन को संपीड़ित करते हैं, क्योंकि वजन स्मृति पर हावी होता है जबकि सक्रियण परिमाणीकरण सटीकता को अधिक नुकसान पहुंचाता है।

सामरिक प्रभाव

लागत और बजट

वास्तुकला संबंधी निर्णय वर्षों तक प्रदर्शन और परिचालन लागत को संचालित करते हैं।

स्पष्ट निर्णय

तकनीकी शिक्षा टीमों को सही स्टैक चुनने में मदद करती है, न कि केवल नवीनतम स्टैक चुनने में।

गुणवत्ता नियंत्रण

बेहतर इंजीनियरिंग विकल्प उत्पादन में विश्वसनीयता की घटनाओं को कम करते हैं।

प्रशिक्षण के बाद GPTQ और AWQ परिमाणीकरण का भविष्य

परिमाणीकरण 4 बिट से नीचे 3-बिट, 2-बिट और मिश्रित-परिशुद्धता योजनाओं की ओर धकेल रहा है, जिसे अक्सर विरलता के साथ जोड़ा जाता है। सेवारत इंजनों के साथ घनिष्ठ युग्मन की अपेक्षा करें ताकि परिमाणीकरण, केवी-कैश संपीड़न, और सट्टा डिकोडिंग एक साथ काम करें। NVFP4 और MXFP4 जैसे निम्न-बिट प्रारूपों के लिए हार्डवेयर समर्थन परिपक्व हो रहा है, और स्वचालित उपकरण तेजी से प्रति-परत बिट चौड़ाई चुनेंगे। व्यापक लक्ष्य डिफ़ॉल्ट के रूप में लगभग दोषरहित 4-बिट (और निचला) है, जिससे मजबूत मॉडल हर जगह सेवा के लिए सस्ते हो जाते हैं।

वास्तविक विश्व कार्यान्वयन

4-बिट जीपीटीक्यू वेट का उपयोग करके एकल 24 जीबी उपभोक्ता जीपीयू पर 70-बिलियन-पैरामीटर लामा मॉडल चलाना।

AWQ-मात्राबद्ध मॉडल लागत-कुशल उत्पादन एपीआई के लिए वीएलएलएम में उच्च थ्रूपुट पर काम करते हैं।

लैपटॉप सीपीयू पर स्थानीय रूप से भाषा मॉडल चलाने के लिए परिमाणित जीजीयूएफ भार का उपयोग करके llama.cpp।

हगिंग फेस की ऑटोजीपीटीक्यू और ऑटोएडब्ल्यूक्यू लाइब्रेरी डेवलपर्स को कोड की कुछ पंक्तियों में डाउनलोड किए गए मॉडल को मापने की सुविधा देती है।

जोखिम और रेलिंग

एक बेंचमार्क को अनुकूलित करने से व्यापक सिस्टम कमजोरियों को छुपाया जा सकता है।

बुनियादी ढांचे और रखरखाव की लागत को अक्सर कम करके आंका जाता है।

जैसे-जैसे सिस्टम अधिक जटिल होते जाएंगे सुरक्षा और अवलोकन संबंधी अंतराल बढ़ सकते हैं।

कार्यान्वयन रोडमैप

1

कार्यान्वयन से पहले विलंबता, गुणवत्ता और लागत लक्ष्य परिभाषित करें।

2

यथार्थवादी लोड और डेटा स्थितियों के तहत बेंचमार्क।

3

त्रुटियों, बहाव और उपयोगकर्ता प्रभाव के लिए उपकरण निगरानी।

4

स्केलिंग से पहले रोलबैक और घटना प्रतिक्रिया पथ तैयार करें।

अन्वेषण करते रहें

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the GPTQ and AWQ Post-Training Quantization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

प्रश्नोत्तरी प्रारंभ करें

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

अगली गाइड

प्रशिक्षण डेटा एट्रिब्यूशन के लिए प्रभाव कार्य

अक्सर पूछे जाने वाले प्रश्नों

What is GPTQ and AWQ Post-Training Quantization?

GPTQ और AWQ पहले से प्रशिक्षित भाषा मॉडल को 4-बिट परिशुद्धता तक सिकोड़ने की दो प्रमुख विधियाँ हैं ताकि वे सस्ते, छोटे हार्डवेयर पर चलें। यही कारण है कि आप डेटासेंटर रैक के बजाय एकल उपभोक्ता जीपीयू पर एक सक्षम मॉडल चला सकते हैं।

'प्रशिक्षणोत्तर परिमाणीकरण' का क्या अर्थ है?

प्रशिक्षण के बाद परिमाणीकरण एक तैयार मॉडल के वजन की सटीकता को कम कर देता है (उदाहरण के लिए, 4 बिट्स तक) इसे स्क्रैच से पुनः प्रशिक्षित किए बिना।

मात्रा निर्धारित करते समय पूर्णांकन त्रुटियों की भरपाई के लिए GPTQ किस जानकारी का उपयोग करता है?

जीपीटीक्यू यह समझने के लिए अनुमानित हेसियन का उपयोग करता है कि एक वजन की मात्रा निर्धारित करने से नुकसान पर क्या प्रभाव पड़ता है, फिर क्षतिपूर्ति के लिए शेष वजन को समायोजित करता है।

कौन सी मुख्य अंतर्दृष्टि AWQ (सक्रियण-जागरूक वजन परिमाणीकरण) को संचालित करती है?

AWQ सक्रियण परिमाणों का उपयोग करके मुख्य भार चैनलों की पहचान करता है और स्केलिंग के माध्यम से उनकी सुरक्षा करता है, क्योंकि कुछ चैनल असंगत रूप से मायने रखते हैं।

16-बिट भार की तुलना में 4-बिट परिमाणीकरण लगभग कितनी मेमोरी बचाता है?

16 बिट्स से 4 बिट्स प्रति वजन तक जाने से वजन मेमोरी लगभग एक चौथाई तक कम हो जाती है, जो लगभग 4x की कमी है।

GPTQ और AWQ दोनों आम तौर पर वजन की मात्रा क्यों निर्धारित करते हैं लेकिन सक्रियता को उच्च परिशुद्धता पर क्यों रखते हैं?

वजन मुख्य मेमोरी लागत है, जबकि सक्रियण सटीक हानि के प्रति अधिक संवेदनशील होते हैं, इसलिए केवल वजन का परिमाणीकरण आम पसंदीदा स्थान है।