ምን ተፈጠረ
NVIDIA የጃኤክስ እና የትራንስፎርመር ሞተር ማሻሻያዎችን ስብስብ ለጠብ-አልባ ድብልቅ-የባለሙያዎች ስልጠና ይገልፃል፣ የቡድን GEMM፣ የተዋሃደ ኤክስፐርት-ትይዩ መላኪያ እና ኦፕሬሽኖችን ማጣመር፣ NCCL EP፣ XLA multistream collectives፣ MXFP8 የቡድን አሃዛዊነት እና የአስተናጋጅ ማግበርን ጨምሮ። ኩባንያው ያልተመቻቸ የDeepSeek-V3 የሥልጠና መነሻ መስመር በአንድ ጂፒዩ 103 TFLOPS ደርሷል፣ ከተመቻቹ በኋላ ከ1,068 TFLOPS በጂፒዩ ላይ ደርሷል፣ እና ከጫፍ እስከ ጫፍ ያለው ልኬት በ10x አካባቢ ተሻሽሏል። NVIDIA በ1,024 ጂፒዩዎች ላይ 97% የማሳያ ብቃትን ዘግቧል። የተመቻቹ ክፍሎች በ NVIDIA NGC MaxText መያዣ ውስጥ ተካተዋል፣ አወቃቀሩን ለመፈተሽ እና ለማባዛት መመሪያዎች።
የNVIDIA ልጥፍ የሚያተኩረው ጠብታ በሌለው ድብልቅ-የባለሙያዎች ስልጠና ላይ ነው፣ በዚህ ውስጥ እያንዳንዱ ማስመሰያ በተመረጠው ኤክስፐርት የሚሰራው ማዘዋወር ያልተስተካከለ የባለሙያ ጭነት በሚፈጥርበት ጊዜም። ከመጠን በላይ ፍሰትን ከሚቀንሱ ወይም ባለሙያዎችን ወደ ቋሚ መጠኖች ከሚያስተካክሉ አቅም ላይ ከተመሠረቱ አቀራረቦች በተለየ፣ ጠብታ የሌለው ሥልጠና ተለዋዋጭ የማስመሰያ ቆጠራዎችን ለመቆጣጠር ከርነሎች እና የመገናኛ መንገዶችን ይፈልጋል። NVIDIA እነዚህ ያልተስተካከሉ ቅርፆች የተበላሹ ተንከሮችን ያመነጫሉ እና ጂፒዩዎች በመላክ፣ ለሁሉም-ለሁሉም ግንኙነት እና የባለሙያ ስሌት እንዲቆዩ ሊተዉ እንደሚችሉ ይናገራል።
የተዘገበው ለውጦች በበርካታ ንብርብሮች ላይ ይሰራሉ. የትራንስፎርመር ኢንጂን በቡድን የተመደበው GEMM በተለዋዋጭ ርዝመት ያለው ኤክስፐርት ቡድኖችን በአንድ የከርነል ጥሪ ያካሂዳል፣ የተቀላቀለ መላክ እና ክወናዎችን እና የNCCL EP የጀርባ አድራሻን የቶከኖች እንቅስቃሴን በጂፒዩዎች መካከል በማጣመር። NVIDIA በተጨማሪም XLA ባለብዙ ዥረት ስብስቦችን፣ አስተናጋጅ ማግበር ማጥፋትን እና MXFP8 በቡድን መጠራት ለውጤቱ አስተዋፅዖ እንዳደረጉ ጠቅሷል።
ኩባንያው የ DeepSeek-V3 671B አወቃቀሩ መነሻ መስመርን ከ103 ወደ 1,068 TFLOPS በጂፒዩ ያሳደገ እና በግምት 10x ከጫፍ እስከ ጫፍ ያለው የውጤት ትርፍ እንዳመጣ ዘግቧል። በ1,024 ጂፒዩዎች ላይ 97% ቅልጥፍናን ሪፖርት አድርጓል። እነዚህ አኃዞች በNVIDIA የቀረቡት ከተመቻቹ ቁልል እንደ ምልከታ እንጂ በግል የተረጋገጡ ውጤቶች አይደሉም።
አተገባበሩ በNVIDIA NGC MaxText ኮንቴይነር ከትራንስፎርመር ሞተር ጋር አብሮ ለመሞከር ይገኛል። የተለያዩ ሞዴሎች የተለያየ ማስተካከያ እንደሚያስፈልጋቸው ያስጠነቅቃል. የዋጋ አሰጣጥ እና የፍቃድ ዝርዝሮች አልተሰጡም።
የምንጭ ዝርዝሮች: developer.nvidia.com ↗
ለምን አስፈላጊ ነው።
ትላልቅ የባለሙያዎች ቅልቅል ሞዴሎች የተመረጡ የባለሙያ ኔትወርኮችን ብቻ በማንቃት ስሌትን ይቀንሳሉ, ነገር ግን ወጣ ገባ ቶከን ማዘዋወራቸው አስቸጋሪ የግንኙነት እና የማስታወስ ማነቆዎችን ይፈጥራል. የNVIDIA ውጤቶች ከተዘገበው አወቃቀሩ በላይ የሚይዙ ከሆነ፣ ለውጦቹ በጣም ትልቅ የMoE ስርዓቶችን ማሰልጠን የታጠቁ ምልክቶችን ሳይጥሉ ወይም እያንዳንዱን ኤክስፐርት ወደ ቋሚ አቅም ሳያስቀምጡ ውጤታማ ሊያደርጋቸው ይችላል። ያ በዋነኛነት የሚመለከተው ትልልቅ የNVIDIA ጂፒዩ ስብስቦችን ለሚሰሩ ድርጅቶች ነው፣ ከየትኛውም በላይ የግንኙነቶች እና ብክነት ስሌት የስልጠና ጊዜን እና ወጪን ሊጎዳ ይችላል። ውጤቶቹ የ NVIDIA የራሱ የይገባኛል ጥያቄዎች; ምንጩ ራሱን የቻለ ቤንችማርኪንግ ወይም ከእያንዳንዱ አማራጭ ትግበራ ጋር ንፅፅር አይሰጥም።
የMoE ስልጠና ለትልቅ AI ሞዴሎች ከጊዜ ወደ ጊዜ አስፈላጊ ነው ምክንያቱም ሁኔታዊ ስሌት ብዙ መመዘኛዎችን በማቆየት በአንድ ቶከን ንቁውን ስሌት ሊቀንስ ይችላል። የምህንድስና ችግር ወደ ማዘዋወር፣ መደበኛ ያልሆነ የማትሪክስ ስራዎች፣ የማህደረ ትውስታ አጠቃቀም እና ትራፊክ ግንኙነት ላይ ይሸጋገራል። እነዚያን ክፍሎች ማሻሻል ሞዴሎችን በምርት ደረጃ ለማሰልጠን የሚያስፈልገውን ጊዜ እና ሃርድዌር ሊቀንስ ይችላል።
ተግባራዊ ታዳሚዎቹ ልዩ ናቸው፡ ተመራማሪዎች እና ኩባንያዎች ቀደም ሲል JAX፣ MaxText፣ NVIDIA ጂፒዩዎች እና ባለብዙ ጂፒዩ ወይም ባለብዙ መስቀለኛ መንገድ መሠረተ ልማት ይጠቀማሉ። ምንጩ ተመሳሳይ ትርፍ ለትንንሽ ስርዓቶች፣ NVIDIA ላልሆኑ ሃርድዌር፣ ጥቅጥቅ ያሉ ሞዴሎች ወይም የስራ ጫናዎች ከዘገበው DeepSeek-V3 ውቅር ውጭ እንደሚተገበር አላረጋገጠም።
የNVIDIA አኃዞች እንደ አቅራቢ ሪፖርት የተደረጉ የአፈጻጸም ይገባኛል ጥያቄዎች መታየት አለባቸው። ምንጩ ከእያንዳንዱ ማመቻቸት ምን ያህል ማሻሻያ እንደሚመጣ ለማወቅ ምንም ገለልተኛ ሙከራዎችን፣ ዝርዝር የወጪ ትንተና ወይም ሙሉ ዘዴ አያቀርብም።
በይነተገናኝ ሜካኒዝም፡ በትክክል እንዴት እንደሚሰራ
ከዚህ ልማት በስተጀርባ ያለውን ቴክኖሎጂ በይነተገናኝ ያስሱ።
Which component of an AI application is the machine-learning model itself?
ቀጥሎ ምን እንደሚታይ
ዋናው ጥያቄ የተዘገበው ግኝቶች በተለያዩ የሞኢ አርክቴክቸር፣ የክላስተር አቀማመጦች፣ የሞዴል መጠኖች እና የጂፒዩ ትውልዶች ይባዛሉ ወይ የሚለው ነው። NVIDIA NVFP4 ለመጨመር አቅዷል፣ ከ GEMM ጋር የተዋሃደ መጠን እና ተጨማሪ ሁሉንም-ለ-ሁሉም መደራረብ። ተጠቃሚዎች እንዲሁም እነዚህ ባህሪያት በJAX እና MaxText የስራ ፍሰቶች ውስጥ መደበኛ መሆናቸውን እና ማሻሻያዎቹ ከፍተኛ ሞዴል-ተኮር ማስተካከያ የሚያስፈልጋቸው መሆን አለመሆኑን መመልከት አለባቸው። ምንጩ በኮንቴይነር ላይ የተመሰረተ የመዳረሻ ዱካንን ይመዘግባል ነገር ግን የዋጋ አሰጣጥን፣ የፍቃድ አሰጣጥ ውሎችን፣ የድጋፍ ቁርጠኝነትን፣ ወይም አጠቃላይ ተገኝነትን ከተጠቀሰው የNGC መያዣ በላይ አይገልጽም።
በሌሎች የMoE ሞዴሎች እና የሃርድዌር አወቃቀሮች ላይ መባዛት የተዘገበው ጥቅማጥቅሞች በስፋት የሚተላለፉ መሆናቸውን ወይም ከDeepSeek-V3 እና NVIDIA ክላስተር ማዋቀር ጋር የተጣመሩ መሆናቸውን ያሳያል።
NVIDIA ወደፊት ሥራ NVFP4፣ የተዋሃደ መጠን ከ GEMM ጋር እና ተጨማሪ ሁሉንም-ለሁሉም መደራረብን ይጨምራል ይላል። እነዚያ ተጨማሪዎች የቁልል አፈጻጸምን እና የማስታወስ ችሎታን የበለጠ ሊጎዱ ይችላሉ።
ምንጩ የእርምጃ ጊዜን፣ TFLOPS በጂፒዩ፣ የሞዴል FLOP አጠቃቀምን፣ የቡድን GEMM መዘግየትን እና የመላክ/ጥምር መዘግየትን መከታተልን ይመክራል። እነዚያ መለኪያዎች ግኝቶችን ከግንኙነት ማሻሻያዎች ለመለየት ይረዳሉ።
ልጥፉ የመያዣውን ዋጋ፣ የፍቃድ አሰጣጥ ሁኔታዎችን፣ የድጋፍ ደረጃን፣ ወይም ሁሉም የተጠቀሱ አካላት ለምርት አጠቃቀም እኩል የበሰሉ መሆናቸውን አይገልጽም።