QLoRA और 4-बिट फ़ाइन-ट्यूनिंग
QLoRA एक ऐसी तकनीक है जो आपको जमे हुए मॉडल को केवल 4 बिट प्रति वजन में संग्रहीत करके एकल उपभोक्ता GPU पर एक विशाल भाषा मॉडल को ठीक करने की सुविधा देती है।
सिंहावलोकन
It made customizing 65B-parameter models possible on hardware that previously could only handle models a fraction of that size.
गहरा गोता
आम तौर पर, एक बड़े मॉडल को फाइन-ट्यूनिंग करने का अर्थ है प्रत्येक वजन को 16-बिट परिशुद्धता में लोड करना और उन सभी को अपडेट करना, जिसके लिए भारी मेमोरी की आवश्यकता होती है। QLoRA दो विचारों को जोड़ता है। सबसे पहले, यह पूर्व-प्रशिक्षित मॉडल को फ़्रीज़ करता है और इसे 4 बिट तक परिमाणित करता है, जिससे मेमोरी लगभग चार गुना कम हो जाती है। दूसरा, यह LoRA का उपयोग करता है: विशाल वजन मैट्रिक्स को अपडेट करने के बजाय, यह उनके साथ छोटे प्रशिक्षण योग्य निम्न-रैंक एडाप्टर मैट्रिक्स को इंजेक्ट करता है, इसलिए केवल कुछ मिलियन पैरामीटर अपडेट होते हैं। 4-बिट बेस स्थिर रहता है जबकि ग्रेडिएंट केवल छोटे एडेप्टर के माध्यम से प्रवाहित होते हैं। डेटमर्स और सहकर्मियों द्वारा 2023 में पेश किए गए, QLoRA ने दिखाया कि एक 48GB GPU पर 65B मॉडल को फाइन-ट्यूनिंग पूर्ण 16-बिट फाइन-ट्यूनिंग की गुणवत्ता से मेल खा सकता है।
तकनीकी अंतर्दृष्टि
QLoRA ने तीन तरकीबें पेश कीं। एनएफ4 (4-बिट नॉर्मलफ्लोट) एक डेटा प्रकार है जो तंत्रिका भार के बेल-वक्र वितरण के लिए अनुकूलित है, जो सादे int4 की तुलना में बेहतर सटीकता देता है। दोहरा परिमाणीकरण परिमाणीकरण स्थिरांक को स्वयं संपीड़ित करता है, जिससे अतिरिक्त मेमोरी बचती है। पृष्ठांकित ऑप्टिमाइज़र लंबे अनुक्रमों के दौरान स्पाइक्स को अवशोषित करने के लिए जीपीयू-सीपीयू एकीकृत मेमोरी का उपयोग करते हैं, जिससे आउट-ऑफ-मेमोरी क्रैश को रोका जा सकता है। फॉरवर्ड और बैकवर्ड पास के दौरान, मैट्रिक्स गुणा के लिए 4-बिट वज़न को 16-बिट में घटाया जाता है, फिर छोड़ दिया जाता है।
सामरिक प्रभाव
गति और पैमाना
भाषा वर्कफ़्लो निरंतरता से समझौता किए बिना तेज़ी से आगे बढ़ सकता है।
पहुंच और पहुंच
यह सभी भाषाओं और संचार शैलियों तक पहुंच का विस्तार करता है।
स्पष्ट निर्णय
टीमें निर्णय लेने में अधिक समय व्यतीत कर सकती हैं जबकि स्वचालन पुनरावृत्ति को संभालता है।
QLoRA और 4-बिट फ़ाइन-ट्यूनिंग का भविष्य
4-बिट फाइन-ट्यूनिंग मानक अभ्यास बन गया है, और अनुसंधान अब 2-बिट और 1-बिट (टर्नरी) प्रतिनिधित्व सहित और भी कम परिशुद्धता की ओर बढ़ रहा है। AWQ, GPTQ और HQQ जैसी नई परिमाणीकरण योजनाएं सटीकता को और अधिक परिष्कृत करती हैं, जबकि QA-LoRA जैसी तकनीकों का लक्ष्य एडेप्टर को मर्ज करने के बाद भी मॉडल को परिमाणित रखना है। जैसे-जैसे ओपन-वेट मॉडल बढ़ते हैं, ऐसे टूलींग की उम्मीद है जो शौक़ीन लोगों को एक ही गेमिंग जीपीयू पर 70बी-प्लस मॉडल को नियमित, लोकतांत्रिक अनुकूलन बनाने में सक्षम बनाता है।
वास्तविक विश्व कार्यान्वयन
एक स्टार्टअप सर्वर क्लस्टर को किराए पर लिए बिना अपने स्वयं के ब्रांड वॉयस में ग्राहक-सहायता सहायक बनाने के लिए एक 48 जीबी जीपीयू पर 70बी लामा मॉडल को फाइन-ट्यून करता है।
एक उपभोक्ता आरटीएक्स 4090 के साथ एक शोधकर्ता एक खुले मॉडल को रातोंरात एक विशिष्ट चिकित्सा प्रश्न-उत्तर डेटासेट में अनुकूलित करता है।
एक डेवलपर विभिन्न कार्यों के लिए दर्जनों छोटे, स्वैपेबल LoRA एडेप्टर बनाता है, सभी मेमोरी में लोड किए गए एक 4-बिट बेस मॉडल को साझा करते हैं।
एक शौकिया मुफ़्त कोलाब-ग्रेड हार्डवेयर का उपयोग करके एक विशेष लेखन शैली की नकल करने के लिए अपने व्यक्तिगत चैट लॉग पर एक मॉडल को फाइन-ट्यून करता है।
जोखिम और रेलिंग
मतिभ्रम वाले तथ्य चुपचाप रिपोर्ट में प्रवेश कर सकते हैं, प्रवाह का समर्थन कर सकते हैं, या अनुसंधान आउटपुट का समर्थन कर सकते हैं।
त्वरित संवेदनशीलता समान अनुरोधों में असंगत परिणाम पैदा कर सकती है।
यदि पहुंच नियंत्रण कमजोर हैं तो संवेदनशील पाठ डेटा उजागर हो सकता है।
कार्यान्वयन रोडमैप
रोलआउट से पहले आउटपुट स्वरूप, टोन और गुणवत्ता मानकों को परिभाषित करें।
जब भी सटीकता मायने रखती है तो विश्वसनीय स्रोतों के साथ जमीनी प्रतिक्रियाएँ।
उच्च जोखिम वाले आउटपुट के लिए एक मानव समीक्षा चेकपॉइंट रखें।
विफलता पैटर्न को ट्रैक करें और संकेतों या वर्कफ़्लो को नियमित रूप से पुनः प्रशिक्षित करें।
अन्वेषण करते रहें
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the QLoRA and 4-Bit Fine-Tuning quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
अगली गाइड
अस्वीकृति नमूनाकरण फ़ाइन-ट्यूनिंग
अक्सर पूछे जाने वाले प्रश्नों
What is QLoRA and 4-Bit Fine-Tuning?
QLoRA एक ऐसी तकनीक है जो आपको जमे हुए मॉडल को केवल 4 बिट प्रति वजन में संग्रहीत करके एकल उपभोक्ता GPU पर एक विशाल भाषा मॉडल को ठीक करने की सुविधा देती है। इसने हार्डवेयर पर 65बी-पैरामीटर मॉडल को अनुकूलित करना संभव बना दिया है जो पहले केवल उस आकार के एक अंश मॉडल को ही संभाल सकता था।
QLoRA के '4-बिट' भाग के पीछे मुख्य मेमोरी-सेविंग विचार क्या है?
QLoRA जमे हुए पूर्व-प्रशिक्षित वजन को 4 बिट प्रति मान पर संग्रहीत करता है, जिससे 16-बिट की तुलना में मेमोरी लगभग चार गुना कम हो जाती है।
QLoRA फाइन-ट्यूनिंग के दौरान, कौन से पैरामीटर वास्तव में ग्रेडिएंट डिसेंट द्वारा अपडेट हो जाते हैं?
आधार मॉडल जमे हुए है; केवल इंजेक्टेड लो-रैंक एडॉप्टर मैट्रिसेस को ग्रेडिएंट अपडेट प्राप्त होता है, जो मापदंडों का एक छोटा सा अंश है।
QLoRA के संदर्भ में NF4 क्या है?
एनएफ4 (नॉर्मलफ्लोट 4-बिट) एक डेटा प्रकार है जिसे सादे int4 की तुलना में बेहतर सटीकता के लिए तंत्रिका नेटवर्क भार के घंटी-वक्र वितरण के आसपास डिज़ाइन किया गया है।
QLoRA पते में 'पृष्ठांकित अनुकूलक' को क्या समस्या है?
पृष्ठांकित ऑप्टिमाइज़र मेमोरी स्पाइक्स को अवशोषित करने के लिए जीपीयू-सीपीयू एकीकृत मेमोरी का उपयोग करते हैं, लंबे इनपुट पर प्रशिक्षण के दौरान आउट-ऑफ-मेमोरी क्रैश को रोकते हैं।
प्रशिक्षण के दौरान 4-बिट वज़न को उच्च परिशुद्धता में कब परिवर्तित किया जाता है?
प्रत्येक मैट्रिक्स को गुणा करने के लिए 4-बिट भार को तुरंत 16-बिट परिशुद्धता में घटाया जाता है, फिर मेमोरी को बचाने के लिए उच्च-परिशुद्धता प्रतिलिपि को फेंक दिया जाता है।