የቴክኒክ መመሪያ

የተቀላቀለ ትክክለኛነት ስልጠና

የድብልቅ ትክክለኛነት ስልጠና የነርቭ ኔትዎርክ ስልጠናን ያፋጥናል እና ብዙ ሂሳብን በ16-ቢት ተንሳፋፊ ነጥብ ከ32-ቢት ይልቅ በማከናወን የማስታወስ አጠቃቀምን ይቀንሳል።

2 ሚን አንብብለመጨረሻ ጊዜ የዘመነው

አጠቃላይ እይታ

It lets the same GPU train bigger models faster with almost no loss in accuracy.

ጥልቅ ዳይቭ

ባህላዊ ስልጠና ክብደቶችን ያከማቻል እና ሂሳብን በ32-ቢት ተንሳፋፊ ነጥብ (FP32) ይሰራል። የተቀላቀለ ትክክለኛነት ለከባድ ማትሪክስ ብዜቶች ዝቅተኛ ትክክለኛ ባለ 16-ቢት ቅርፀቶችን (FP16 ወይም bfloat16) ይጠቀማል፣ የክብደቶችን 32-ቢት 'ዋና ቅጂ' ለተረጋጋ ዝመናዎች እያቆየ። 16-ቢት ቁጥሮች ግማሹን መጠን ስላላቸው፣ በጂፒዩ ማህደረ ትውስታ የበለጠ የሚመጥን እና Tensor Cores በግምት ከ2-8x በፍጥነት ያዘጋጃቸዋል። የሚይዘው የFP16 ጠባብ ክልል ነው፡ ጥቃቅን ቅልመት ወደ ዜሮ ሊፈስ ይችላል። መደበኛው ጥገና የኪሳራ ልኬት ነው፣ ይህም ኪሳራውን ከመመለሷ በፊት በከፍተኛ ሁኔታ በማባዛት ትንንሽ ግሬዲየሎች ተወክለው ይቆያሉ፣ ከዚያ ከክብደቱ ዝማኔ በፊት ይከፋፍለዋል። የNVDIA Apex እና አብሮ የተሰራው AMP (Automatic Mixed Precision) በPyTorch እና TensorFlow ይህንን በራስ ሰር ያደርጉታል።

ቴክኒካዊ ግንዛቤ

FP16 5 ገላጭ ቢትስ ብቻ ነው ያለው፣ ይህም ትንሽ ተለዋዋጭ መጠን ያለው ሲሆን ይህም ቀስ በቀስ የውሃ ፍሰትን ያስከትላል። Bfloat16 8 ገላጭ ቢት (የFP32 ክልል ጋር የሚዛመድ) ነገር ግን ጥቂት የማንቲሳ ቢት ይይዛል፣ ስለዚህ የኪሳራ ልኬትን ብዙም አይፈልግም - ዋናው ምክንያት Google TPUs እና ዘመናዊ ጂፒዩዎች ይደግፋሉ። Tensor Cores ባለ 16-ቢት ኦፔራዶችን በማባዛት ነገር ግን በ FP32 ውስጥ ከፊል ድምርን በማጠራቀም የማጠቃለያ ስህተቶች ሊጣመሩ የሚችሉበትን ትክክለኛነት በመጠበቅ ስራውን ያፋጥነዋል።

ስልታዊ ተጽእኖ

ወጪ እና በጀት

የስነ-ህንፃ ውሳኔዎች ለዓመታት አፈጻጸምን እና የሥራ ማስኬጃ ወጪዎችን ያንቀሳቅሳሉ.

ግልጽ ውሳኔዎች

የቴክኒክ ትምህርት ቡድኖች አዲሱን ብቻ ሳይሆን ትክክለኛውን ቁልል እንዲመርጡ ይረዳል።

የጥራት ቁጥጥር

የተሻሉ የምህንድስና ምርጫዎች በምርት ውስጥ አስተማማኝነት ክስተቶችን ይቀንሳሉ.

የድብልቅ ትክክለኛነት ስልጠና የወደፊት

ትክክለኛነት እየቀነሰ ይሄዳል። በNVDIA Hopper እና ብላክዌል ጂፒዩዎች ላይ የሚደገፈው የFP8 ስልጠና ለድንበር ሞዴሎች መደበኛ እየሆነ መጥቷል፣ እና በ FP4 እና በማይክሮካሊንግ ቅርፀቶች (ኤምኤክስኤፍፒ) ላይ የሚደረግ ጥናት የበለጠ ይገፋል። የንብርብር ትክክለኛነትን በራስ-ሰር ለመምረጥ ማዕቀፎችን ጠብቅ፣ ይበልጥ ጠባብ የሆኑ ቅርጸቶችን በአገር ውስጥ የሚይዝ ሃርድዌር፣ እና በቁጥር የሚታወቅ ስልጠና በዝቅተኛ ትክክለኝነት እና መረጃ መካከል ያለውን መስመር ለማደብዘዝ፣ የትሪሊዮን መለኪያ ሞዴሎችን የስልጠና ወጪን ይቀንሳል።

የእውነተኛ-ዓለም አተገባበር

የPyTorch's torch.cuda.amp.autocast የማስታወስ ችሎታን በግማሽ ለመቀነስ እና በአንድ ጂፒዩ ላይ በእጥፍ ለማሳደግ የስልጠና ዑደትን በመጠቅለል

ኪሳራን ማስተካከልን ለማስወገድ እንደ GPT-style Transformers በ bfloat16 በTPUs ላይ ትልቅ የቋንቋ ሞዴሎችን ማሰልጠን።

የResNet ምስል ስልጠናን ከFP32 ወደ FP16 በመቀየር በ RTX ጂፒዩ ላይ ትልቅ መጠን ያለው ባች መግጠም

የድንበር-ልኬት ሞዴሎችን ቅድመ ሥልጠና ወጪን ለመቀነስ FP8 በ NVIDIA H100 GPUs ላይ የተቀላቀለ ትክክለኛነት

አደጋዎች እና የጥበቃ መንገዶች

አንድ ቤንችማርክን ማሳደግ ሰፋ ያሉ የስርዓት ድክመቶችን ሊደብቅ ይችላል።

የመሠረተ ልማት እና የጥገና ወጪዎች ብዙ ጊዜ ዝቅተኛ ናቸው.

ስርዓቶች ይበልጥ ውስብስብ ሲሆኑ የደህንነት እና የታዛቢነት ክፍተቶች ሊያድጉ ይችላሉ።

የትግበራ ፍኖተ ካርታ

1

ከመተግበሩ በፊት የቆይታ፣ የጥራት እና የወጪ ግቦችን ይግለጹ።

2

ቤንችማርክ በእውነተኛ ጭነት እና የውሂብ ሁኔታዎች።

3

ለስህተቶች፣ ተንሸራታች እና የተጠቃሚ ተጽእኖ የመሳሪያ ክትትል።

4

ከመጠኑ በፊት የመመለሻ እና የአደጋ ምላሽ መንገዶችን ያዘጋጁ።

ማሰስዎን ይቀጥሉ

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Mixed Precision Training quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

ጥያቄ ጀምር

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

ቀጣይ መመሪያ

የውሸት መሰየሚያ እና ራስን ማሰልጠን

በተደጋጋሚ የሚጠየቁ ጥያቄዎች

What is Mixed Precision Training?

የድብልቅ ትክክለኛነት ስልጠና የነርቭ ኔትዎርክ ስልጠናን ያፋጥናል እና ብዙ ሂሳብን በ16-ቢት ተንሳፋፊ ነጥብ ከ32-ቢት ይልቅ በማከናወን የማስታወስ አጠቃቀምን ይቀንሳል። ተመሳሳዩ ጂፒዩ ትላልቅ ሞዴሎችን በፍጥነት እንዲያሰለጥነው ያስችላል ከሞላ ጎደል ትክክለኛነት።

ለምንድነው የተቀላቀለ ትክክለኛ ስልጠና የክብደቶችን 32-ቢት 'ማስተር ኮፒ' የሚይዘው?

የክብደት ማሻሻያዎች ብዙውን ጊዜ በጣም ትንሽ ናቸው; እነሱን በ16-ቢት ማጠራቀም ትክክለኝነትን ያጣል፣ ስለዚህ የሙሉ ትክክለኛነት ዋና ቅጂ ዝመናዎችን ትክክለኛ ያደርገዋል።

በ FP16 ስልጠና ውስጥ የኪሳራ ሚዛን ምን ችግር ይፈታል?

FP16 የተገደበ ተለዋዋጭ ክልል አለው፣ ስለዚህ ትናንሽ ቀስቶች ወደ ዜሮ ሊጠጋጉ ይችላሉ። ከ backprop በፊት ኪሳራውን ማባዛት እንዲወክሉ ያደርጋቸዋል።

bfloat16 ከ FP16 በላይ ምን ጥቅም አለው?

Bfloat16 እንደ FP32 ያሉ 8 ገላጭ ቢት ይይዛል፣ ስለዚህ ተለዋዋጭ ክልሉ ትልቅ ነው እና ቀስ በቀስ የውሃ ውስጥ ፍሰት ብርቅ ነው።

16-ቢት ግብዓቶችን በሚጠቀሙበት ጊዜ Tensor Cores እንዴት ትክክለኛነትን ይጠብቃሉ?

Tensor Cores ባለ 16-ቢት ኦፔራዶችን ያባዛሉ ነገርግን በ32-ቢት ይከማቻሉ ይህም የማጠቃለያ ስህተቶች እንዳይቀላቀሉ ይከላከላል።

በስልጠና ወቅት ከ32-ቢት እሴቶች ይልቅ 16-ቢት መጠቀም ቀዳሚ ጥቅም ምንድነው?

የግማሽ መጠን ቁጥሮች በጂፒዩ ማህደረ ትውስታ ውስጥ ተጨማሪ ውሂብን ያሟሉ እና ልዩ የሃርድዌር ማትሪክስ ሒሳብን ብዙ ጊዜ በፍጥነት እንዲሰራ ያስችለዋል።