የሞዴል መቁጠር
የሞዴል መጠኗ ቁጥሮቹን በጥቂቱ በማከማቸት የነርቭ ኔትወርክን ይቀንሳል፣ ስለዚህ ያው ሞዴል በፍጥነት እና በትንሽ ሃርድዌር ይሰራል።
አጠቃላይ እይታ
It is the main reason large models can fit on a single GPU, a laptop, or even a phone.
ጥልቅ ዳይቭ
የሰለጠኑ ሞዴሎች እያንዳንዱን ክብደት እንደ 32-ቢት ወይም 16-ቢት ተንሳፋፊ-ነጥብ ቁጥር ያከማቻሉ። መጠኗ ዝቅተኛ ትክክለኛነት ያላቸውን እንደ 8-ቢት ኢንቲጀር (INT8) ወይም 4-ቢት እሴቶች (INT4)፣ ማህደረ ትውስታን ከ4x እስከ 8x በመቁረጥ ይተካል። በ16-ቢት ወደ 140GB የሚያስፈልገው የ70-ቢሊየን መለኪያ ሞዴል ከአንድ የሸማች ጂፒዩ ጋር የሚገጣጠም በ4-ቢት ወደ 35ጂቢ ሊወርድ ይችላል። የተያዘው ትክክለኛነት ነው፡ ሰፊ የእሴቶችን መጠን ወደ 256 ወይም 16 ባልዲዎች መጨፍለቅ ዝርዝሩን ያጣል። እንደ GPTQ፣ AWQ እና NF4 ቅርጸት በQLoRA ውስጥ ጥቅም ላይ የሚውለው ዘመናዊ ዘዴዎች ብልጥ የሆኑ መለኪያዎችን ይመርጣሉ እና በጣም ሚስጥራዊነት ያላቸውን ክብደቶች ይከላከላሉ፣ ስለዚህ የጥራት ማጣት ብዙ ጊዜ ትንሽ ነው። እንደ llama.cpp እና Olama ያሉ መሳሪያዎች ያለ የውሂብ ማዕከል አቅም ያላቸውን ሞዴሎችን በሀገር ውስጥ ማሄድ የሚችሉት ለምን እንደሆነ ኳንቲዜሽን ነው።
ቴክኒካዊ ግንዛቤ
መለኪያ እና ዜሮ-ነጥብ በመጠቀም ትክክለኛ እሴቶችን ወደ ትንሽ ኢንቲጀር ፍርግርግ ያዘጋጃል፡ የተከማቸ_int = ክብ(እሴት / ሚዛን) + ዜሮ_ነጥብ። ልኬቱን በደንብ መምረጥ ሙሉው ጨዋታ ነው። በሰርጥ ወይም በቡድን ልኬት ለክብደት ማትሪክስ ቁርጥራጭ ሚዛኖችን ያቆያል፣ ይህም አስፈላጊ በሆነበት ቦታ ላይ ትክክለኛነትን ይጠብቃል። የድህረ-ስልጠና ብዛት ልክ የተጠናቀቀን ሞዴል ይለውጣል፣ የኳንትላይዜሽን እውቀት ያለው ስልጠና ደግሞ በስልጠና ወቅት ማዞሪያን ስለሚመስል አውታረ መረቡ መታገስን ይማራል፣ ይህም አብዛኛውን ጊዜ የተሻለ ዝቅተኛ-ቢት ትክክለኛነትን ይሰጣል።
ስልታዊ ተጽእኖ
ወጪ እና በጀት
የስነ-ህንፃ ውሳኔዎች ለዓመታት አፈጻጸምን እና የሥራ ማስኬጃ ወጪዎችን ያንቀሳቅሳሉ.
ግልጽ ውሳኔዎች
የቴክኒክ ትምህርት ቡድኖች አዲሱን ብቻ ሳይሆን ትክክለኛውን ቁልል እንዲመርጡ ይረዳል።
የጥራት ቁጥጥር
የተሻሉ የምህንድስና ምርጫዎች በምርት ውስጥ አስተማማኝነት ክስተቶችን ይቀንሳሉ.
የሞዴል መቁጠር የወደፊት ዕጣ
ሁልጊዜ ዝቅተኛ ትክክለኛነት መደበኛ እንዲሆን ይጠብቁ። ምርምር አስተማማኝ ባለ 4-ቢት፣ 2-ቢት እና አልፎ ተርፎም ሁለትዮሽ ክብደቶችን እና የተቀላቀሉ ትክክለኛ እቅዶችን በመግፋት ስሱ ንብርብሮችን ከፍ ያደርጋሉ። ሃርድዌር የሚከተለው ነው፡ ጂፒዩዎች እና የስልክ ቺፕስ አሁን ቤተኛ INT8፣ INT4 እና FP8 የሂሳብ ክፍሎችን ያካትታሉ። እንደ FP8 እና MXFP4 ያሉ ቅርጸቶች ዓላማቸው የተንሳፋፊዎችን ብዛት ከኢንቲጀር መጠን ጋር ለማጣመር ነው። እንደ QLoRA ካሉ ቴክኒኮች ጋር ተዳምሮ፣ ኳንቲቴሽን የድንበር-ልኬት ሞዴሎችን ለማስኬድ ርካሽ እና በዕለት ተዕለት መሣሪያዎች ላይ እንዲስተካከሉ ያደርጋል።
የእውነተኛ-ዓለም አተገባበር
ባለ 4-ቢት GGUF ፋይሎችን በመጠቀም 7B ወይም 13B Llama ሞዴልን በላፕቶፕ ላይ ከ llama.cpp ወይም Ollama ጋር ማስኬድ።
QLoRA የመሠረት ክብደቶችን በ4-ቢት NF4 ውስጥ በረዶ በማድረግ በአንድ ጂፒዩ ላይ አንድ ትልቅ ሞዴል በጥሩ ሁኔታ ማስተካከል።
ረዳቶች ከመስመር ውጭ እና በግል እንዲሰሩ የ INT8 ሞዴሎችን በመሳሪያ ላይ በሚሰሩ ስልኮች ላይ ማሰማራት።
INT8/FP8 መጠኗ በግምት በእጥፍ የሚጨምር እና የማህደረ ትውስታ ወጪን የሚቀንስባቸው ርካሽ የኤፒአይ የመጨረሻ ነጥቦችን ማገልገል።
አደጋዎች እና የጥበቃ መንገዶች
አንድ ቤንችማርክን ማሳደግ ሰፋ ያሉ የስርዓት ድክመቶችን ሊደብቅ ይችላል።
የመሠረተ ልማት እና የጥገና ወጪዎች ብዙ ጊዜ ዝቅተኛ ናቸው.
ስርዓቶች ይበልጥ ውስብስብ ሲሆኑ የደህንነት እና የታዛቢነት ክፍተቶች ሊያድጉ ይችላሉ።
የትግበራ ፍኖተ ካርታ
ከመተግበሩ በፊት የቆይታ፣ የጥራት እና የወጪ ግቦችን ይግለጹ።
ቤንችማርክ በእውነተኛ ጭነት እና የውሂብ ሁኔታዎች።
ለስህተቶች፣ ተንሸራታች እና የተጠቃሚ ተጽእኖ የመሳሪያ ክትትል።
ከመጠኑ በፊት የመመለሻ እና የአደጋ ምላሽ መንገዶችን ያዘጋጁ።
ማሰስዎን ይቀጥሉ
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Model Quantization quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
ቀጣይ መመሪያ
የሞዴል መዝገቦች
በተደጋጋሚ የሚጠየቁ ጥያቄዎች
What is Model Quantization?
የሞዴል መጠኗ ቁጥሮቹን በጥቂቱ በማከማቸት የነርቭ ኔትወርክን ይቀንሳል፣ ስለዚህ ያው ሞዴል በፍጥነት እና በትንሽ ሃርድዌር ይሰራል። ትላልቅ ሞዴሎች በአንድ ጂፒዩ፣ ላፕቶፕ ወይም ስልክ ላይ ሊጣጣሙ የሚችሉበት ዋናው ምክንያት ነው።
ስለ ነርቭ አውታረመረብ ሞዴል መመዘኛ በዋነኝነት የሚለወጠው ምንድን ነው?
Quantization ተመሳሳዩን መመዘኛዎች በጥቂት ቢትስ ያከማቻል (ለምሳሌ INT8 ወይም INT4 ከ16- ወይም 32-ቢት ተንሳፋፊዎች ይልቅ)፣ ማህደረ ትውስታን በመቀነስ እና ሂሳብን ያፋጥናል።
አንድን ሞዴል ከ16-ቢት ወደ 4-ቢት ቆጣቢነት ምን ያህል ማህደረ ትውስታ ሊለውጠው ይችላል?
በክብደት ከ16 ቢት ወደ 4 ቢት መሄድ ማከማቻውን በአራት እጥፍ ያህል ይቀንሳል፣ ለዚህም ነው ግዙፍ ሞዴሎች በአንድ ጂፒዩ ላይ ሊገጣጠሙ የሚችሉት።
የጥቃት ዝቅተኛ-ቢት መጠን መቀነስ ዋነኛው ኪሳራ ምንድነው?
ሰፋ ያለ የእሴቶችን ካርታ በተወሰኑ ደረጃዎች ላይ ማድረግ ዝርዝር ጉዳዮችን ያጣል፣ ይህም ብልጥ ልኬት ሚስጥራዊነት ያለው ክብደቶችን ካልጠበቀ በስተቀር ጥራትን ሊቀንስ ይችላል።
የቁጥጥር እውቀት ያለው ስልጠና ከስልጠና በኋላ የመጠን መለኪያ እንዴት ይለያል?
ኳንትላይዜሽንን ጠንቅቆ የሚያውቅ ስልጠና የማዞሪያ ስህተቱን ወደ የስልጠና ዑደት ይገነባል፣ ስለዚህ አውታረ መረቡ ይስማማል እና ብዙ ጊዜ በዝቅተኛ ቢት ስፋቶች የበለጠ ትክክለኛነትን ይይዛል።
ጥሩ ማስተካከያ ትላልቅ ሞዴሎችን በአንድ ጂፒዩ ላይ በተመጣጣኝ ዋጋ ለማቅረብ 4-ቢት ኳንቲዜሽን የሚጠቀመው የትኛው ዘዴ ነው?
QLoRA የመሠረት ሞዴሉን በ4-ቢት NF4 ቅርፀት እንዲቀዘቅዝ ያደርገዋል እና አነስተኛ አስማሚ ክብደቶችን ያሠለጥናል፣ ይህም ትላልቅ ሞዴሎች በመጠኑ ሃርድዌር ላይ እንዲስተካከሉ ያስችላቸዋል።