Mafunzo ya Usahihi Mchanganyiko
Mafunzo ya usahihi mchanganyiko huharakisha mafunzo ya mtandao wa neva na kupunguza matumizi ya kumbukumbu kwa kufanya hesabu nyingi katika sehemu ya kuelea ya biti-16 badala ya biti-32.
Muhtasari
It lets the same GPU train bigger models faster with almost no loss in accuracy.
Dive ya kina
Mafunzo ya kitamaduni huhifadhi uzani na huendesha hesabu katika sehemu ya kuelea ya 32-bit (FP32). Usahihi mseto hutumia umbizo la chini-usahihi la biti-16 (FP16 au bfloat16) kwa zidishio zito la matrix, huku ikiweka 'nakala kuu' ya biti 32 ya uzani kwa masasisho thabiti. Kwa sababu nambari za biti 16 ni nusu ya ukubwa, zinafaa zaidi katika kumbukumbu ya GPU na Tensor Cores huzichakata takriban 2-8x haraka. Ukamataji ni safu nyembamba ya FP16: gradients ndogo zinaweza kupita hadi sifuri. Marekebisho ya kawaida ni kuongeza hasara, ambayo huzidisha hasara kwa sababu kubwa kabla ya uenezaji nyuma ili gradient ndogo zisalie kuwakilishwa, kisha kuigawanya kabla ya kusasisha uzito. Apex ya NVIDIA na AMP iliyojengewa ndani ( Usahihi Mseto Otomatiki) katika PyTorch na TensorFlow hurekebisha hii kiotomatiki.
Ufahamu wa Kiufundi
FP16 ina biti 5 pekee za kipeo, ikitoa safu ndogo inayobadilika ambayo husababisha utiririshaji wa upinde rangi. Bfloat16 huhifadhi biti 8 za kipeo (inayolingana na safu ya FP32) lakini biti chache za mantissa, kwa hivyo haihitaji kuongeza upotezaji - sababu kuu Google TPU na GPU za kisasa zinaipendelea. Tensor Cores huharakisha kazi kwa kuzidisha uendeshaji wa biti-16 lakini kukusanya kiasi kidogo katika FP32, kuhifadhi usahihi ambapo makosa ya muhtasari yangetokea.
Athari za kimkakati
Cost and budget
Maamuzi ya usanifu huendesha utendaji na gharama ya uendeshaji kwa miaka.
Maamuzi ya wazi zaidi
Elimu ya kiufundi husaidia timu kuchagua safu sahihi, sio tu mpya zaidi.
Quality control
Chaguo bora za uhandisi hupunguza matukio ya kuaminika katika uzalishaji.
Mustakabali wa Mafunzo ya Usahihi Mchanganyiko
Usahihi unaendelea kushuka. Mafunzo ya FP8, yanayotumika kwenye NVIDIA Hopper na Blackwell GPUs, yanazidi kuwa ya kawaida kwa miundo ya mipakani, na utafiti katika FP4 na umbizo la microscaling (MXFP) unasukuma zaidi. Tarajia mifumo ya kuchagua kiotomatiki usahihi wa kila safu, maunzi ya kushughulikia umbizo la kiasili, na mafunzo ya kutambua idadi ili kutia ukungu kati ya mafunzo ya usahihi wa chini na uelekezaji, kupunguza gharama ya mafunzo ya miundo yenye vigezo trilioni.
Utekelezaji wa Ulimwengu Halisi
Torch ya PyTorch.cuda.amp.autocast ikifunga kitanzi cha mafunzo ili kupunguza takriban nusu ya kumbukumbu na upitishaji mara mbili kwenye GPU moja.
Kufunza miundo mikubwa ya lugha kama vile vibadilishaji vya kubadilisha mtindo wa GPT katika bfloat16 kwenye TPU ili kuzuia urekebishaji wa upotezaji.
Kuweka ukubwa wa kundi kubwa kwenye RTX GPU ya mtumiaji kwa kubadili mafunzo ya picha ya ResNet kutoka FP32 hadi FP16
Usahihi mchanganyiko wa FP8 kwenye GPU za NVIDIA H100 ili kupunguza gharama ya mafunzo ya awali ya miundo ya mizani ya mipaka
Hatari & Walinzi
Kuboresha kiwango kimoja kunaweza kuficha udhaifu mkubwa wa mfumo.
Gharama za miundombinu na matengenezo mara nyingi hupunguzwa.
Mapengo ya usalama na uonekanaji yanaweza kukua kadiri mifumo inavyozidi kuwa ngumu.
Ramani ya Utekelezaji
Bainisha muda, ubora na malengo ya gharama kabla ya utekelezaji.
Benchmark chini ya mzigo halisi na hali ya data.
Ufuatiliaji wa ala kwa makosa, kuteleza, na athari za mtumiaji.
Tayarisha njia za urejeshaji na majibu ya matukio kabla ya kuongeza ukubwa.
Endelea Kuchunguza
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Mixed Precision Training quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Mwongozo unaofuata
Kuweka Lebo za Uongo na Kujizoeza
Maswali yanayoulizwa mara kwa mara
What is Mixed Precision Training?
Mafunzo ya usahihi mchanganyiko huharakisha mafunzo ya mtandao wa neva na kupunguza matumizi ya kumbukumbu kwa kufanya hesabu nyingi katika sehemu ya kuelea ya biti-16 badala ya biti-32. Huruhusu GPU sawa kufunza miundo mikubwa kwa haraka bila hasara yoyote katika usahihi.
Kwa nini mafunzo ya usahihi mchanganyiko huweka 'nakala kuu' ya 32-bit ya uzani?
Sasisho za uzito mara nyingi ni ndogo sana; kuzikusanya katika 16-bit kunaweza kupoteza usahihi, kwa hivyo nakala kuu ya usahihi kamili huweka masasisho sahihi.
Je, kuongeza hasara kunatatua tatizo gani katika mafunzo ya FP16?
FP16 ina anuwai ndogo ya nguvu, kwa hivyo gradient ndogo zinaweza kuzunguka hadi sifuri; kuzidisha hasara kabla ya backprop huwaweka kuwakilishwa.
bfloat16 ina faida gani zaidi ya FP16?
Bfloat16 huweka vipeo 8 kama FP32, kwa hivyo safu yake inayobadilika ni kubwa na mtiririko wa chini wa gradient ni nadra.
Je, Tensor Cores huhifadhije usahihi wakati wa kutumia pembejeo za 16-bit?
Tensor Cores huzidisha uendeshaji wa biti-16 lakini hujilimbikiza katika biti-32, kuzuia hitilafu za muhtasari kuunganishwa.
Ni faida gani ya msingi ya kutumia 16-bit badala ya maadili 32-bit wakati wa mafunzo?
Nambari za saizi nusu hutoshea data zaidi kwenye kumbukumbu ya GPU na kuruhusu uchakataji wa maunzi hesabu mara kadhaa haraka zaidi.