ወደ ዜና ተመለስ
ፈጠራAI Understanding አጭር መግለጫ

NVIDIA በJAX ውስጥ 10x ፈጣን ጠብታ የሌለው MoE ስልጠና ዘግቧል

NVIDIA የትራንስፎርመር ኢንጂን እና ጃኤክስ ማሻሻያ DeepSeek-V3 671B የሥልጠና ውጤት በ10x ያህል ጨምሯል እና በ1,024 ጂፒዩዎች ላይ 97% ቅልጥፍናን ማሳካት ችሏል። የተመቻቸ መንገድ በNVIDIA NGC MaxText መያዣ ውስጥ በሴፕቴምበር 9፣ 2026 ወይም ከዚያ በላይ ተካትቷል።

4 min readRead the primary source
Source-provided image accompanying NVIDIA reports 10x faster dropless MoE training in JAX
ዋና-ምንጭ ሰነድምንጭ ተመዝግቧል
አታሚ
developer.nvidia.com
ምንጭ አገናኝ
developer.nvidia.comhttps://developer.nvidia.com/blog/accelerating-dropless-moe-training-in-jax-with-nvidia-transformer-engine/
የምንጭ ዓይነት
ዋና ሰነድ - ኦፊሴላዊ ማስታወቂያ ፣ ወረቀት ፣ ፋይል ወይም የመጀመሪያ ወገን ገጽ በቀጥታ እናነባለን።
አውድይህንን በ60 ሰከንድ ውስጥ ይረዱት።

እዚ ጀምር

ቁልፍ ቃላት

የባለሙያዎች ድብልቅ (MoE)
በአንድ ግብአት የተመረጡ ባለሙያዎች ብቻ የሚሰሩበት ልዩ ንዑስ አውታረ መረቦች ያለው አርክቴክቸር።
ማህደረ ትውስታ (ወኪል ማህደረ ትውስታ)
የተከማቸ አውድ የኤ ወኪል ቀጣይነትን ለማሻሻል በሁሉም ደረጃዎች ወይም ክፍለ ጊዜዎች ይጠቀማል።
መቁጠር
የሞዴል ክብደቶችን ወደ ዝቅተኛ ትክክለኛ ቅርጸቶች እንደ 8-ቢት ወይም 4-ቢት መለወጥ።
እራስህን ፈትን።AI ሞዴሎች የተብራሩ ጥያቄዎች

ምን ተፈጠረ

NVIDIA የጃኤክስ እና የትራንስፎርመር ሞተር ማሻሻያዎችን ስብስብ ለጠብ-አልባ ድብልቅ-የባለሙያዎች ስልጠና ይገልፃል፣ የቡድን GEMM፣ የተዋሃደ ኤክስፐርት-ትይዩ መላኪያ እና ኦፕሬሽኖችን ማጣመር፣ NCCL EP፣ XLA multistream collectives፣ MXFP8 የቡድን አሃዛዊነት እና የአስተናጋጅ ማግበርን ጨምሮ። ኩባንያው ያልተመቻቸ የDeepSeek-V3 የሥልጠና መነሻ መስመር በአንድ ጂፒዩ 103 TFLOPS ደርሷል፣ ከተመቻቹ በኋላ ከ1,068 TFLOPS በጂፒዩ ላይ ደርሷል፣ እና ከጫፍ እስከ ጫፍ ያለው ልኬት በ10x አካባቢ ተሻሽሏል። NVIDIA በ1,024 ጂፒዩዎች ላይ 97% የማሳያ ብቃትን ዘግቧል። የተመቻቹ ክፍሎች በ NVIDIA NGC MaxText መያዣ ውስጥ ተካተዋል፣ አወቃቀሩን ለመፈተሽ እና ለማባዛት መመሪያዎች።

የNVIDIA ልጥፍ የሚያተኩረው ጠብታ በሌለው ድብልቅ-የባለሙያዎች ስልጠና ላይ ነው፣ በዚህ ውስጥ እያንዳንዱ ማስመሰያ በተመረጠው ኤክስፐርት የሚሰራው ማዘዋወር ያልተስተካከለ የባለሙያ ጭነት በሚፈጥርበት ጊዜም። ከመጠን በላይ ፍሰትን ከሚቀንሱ ወይም ባለሙያዎችን ወደ ቋሚ መጠኖች ከሚያስተካክሉ አቅም ላይ ከተመሠረቱ አቀራረቦች በተለየ፣ ጠብታ የሌለው ሥልጠና ተለዋዋጭ የማስመሰያ ቆጠራዎችን ለመቆጣጠር ከርነሎች እና የመገናኛ መንገዶችን ይፈልጋል። NVIDIA እነዚህ ያልተስተካከሉ ቅርፆች የተበላሹ ተንከሮችን ያመነጫሉ እና ጂፒዩዎች በመላክ፣ ለሁሉም-ለሁሉም ግንኙነት እና የባለሙያ ስሌት እንዲቆዩ ሊተዉ እንደሚችሉ ይናገራል።

የተዘገበው ለውጦች በበርካታ ንብርብሮች ላይ ይሰራሉ. የትራንስፎርመር ኢንጂን በቡድን የተመደበው GEMM በተለዋዋጭ ርዝመት ያለው ኤክስፐርት ቡድኖችን በአንድ የከርነል ጥሪ ያካሂዳል፣ የተቀላቀለ መላክ እና ክወናዎችን እና የNCCL EP የጀርባ አድራሻን የቶከኖች እንቅስቃሴን በጂፒዩዎች መካከል በማጣመር። NVIDIA በተጨማሪም XLA ባለብዙ ዥረት ስብስቦችን፣ አስተናጋጅ ማግበር ማጥፋትን እና MXFP8 በቡድን መጠራት ለውጤቱ አስተዋፅዖ እንዳደረጉ ጠቅሷል።

ኩባንያው የ DeepSeek-V3 671B አወቃቀሩ መነሻ መስመርን ከ103 ወደ 1,068 TFLOPS በጂፒዩ ያሳደገ እና በግምት 10x ከጫፍ እስከ ጫፍ ያለው የውጤት ትርፍ እንዳመጣ ዘግቧል። በ1,024 ጂፒዩዎች ላይ 97% ቅልጥፍናን ሪፖርት አድርጓል። እነዚህ አኃዞች በNVIDIA የቀረቡት ከተመቻቹ ቁልል እንደ ምልከታ እንጂ በግል የተረጋገጡ ውጤቶች አይደሉም።

አተገባበሩ በNVIDIA NGC MaxText ኮንቴይነር ከትራንስፎርመር ሞተር ጋር አብሮ ለመሞከር ይገኛል። የተለያዩ ሞዴሎች የተለያየ ማስተካከያ እንደሚያስፈልጋቸው ያስጠነቅቃል. የዋጋ አሰጣጥ እና የፍቃድ ዝርዝሮች አልተሰጡም።

የምንጭ ዝርዝሮች: developer.nvidia.com ↗

ለምን አስፈላጊ ነው።

ትላልቅ የባለሙያዎች ቅልቅል ሞዴሎች የተመረጡ የባለሙያ ኔትወርኮችን ብቻ በማንቃት ስሌትን ይቀንሳሉ, ነገር ግን ወጣ ገባ ቶከን ማዘዋወራቸው አስቸጋሪ የግንኙነት እና የማስታወስ ማነቆዎችን ይፈጥራል. የNVIDIA ውጤቶች ከተዘገበው አወቃቀሩ በላይ የሚይዙ ከሆነ፣ ለውጦቹ በጣም ትልቅ የMoE ስርዓቶችን ማሰልጠን የታጠቁ ምልክቶችን ሳይጥሉ ወይም እያንዳንዱን ኤክስፐርት ወደ ቋሚ አቅም ሳያስቀምጡ ውጤታማ ሊያደርጋቸው ይችላል። ያ በዋነኛነት የሚመለከተው ትልልቅ የNVIDIA ጂፒዩ ስብስቦችን ለሚሰሩ ድርጅቶች ነው፣ ከየትኛውም በላይ የግንኙነቶች እና ብክነት ስሌት የስልጠና ጊዜን እና ወጪን ሊጎዳ ይችላል። ውጤቶቹ የ NVIDIA የራሱ የይገባኛል ጥያቄዎች; ምንጩ ራሱን የቻለ ቤንችማርኪንግ ወይም ከእያንዳንዱ አማራጭ ትግበራ ጋር ንፅፅር አይሰጥም።

የMoE ስልጠና ለትልቅ AI ሞዴሎች ከጊዜ ወደ ጊዜ አስፈላጊ ነው ምክንያቱም ሁኔታዊ ስሌት ብዙ መመዘኛዎችን በማቆየት በአንድ ቶከን ንቁውን ስሌት ሊቀንስ ይችላል። የምህንድስና ችግር ወደ ማዘዋወር፣ መደበኛ ያልሆነ የማትሪክስ ስራዎች፣ የማህደረ ትውስታ አጠቃቀም እና ትራፊክ ግንኙነት ላይ ይሸጋገራል። እነዚያን ክፍሎች ማሻሻል ሞዴሎችን በምርት ደረጃ ለማሰልጠን የሚያስፈልገውን ጊዜ እና ሃርድዌር ሊቀንስ ይችላል።

ተግባራዊ ታዳሚዎቹ ልዩ ናቸው፡ ተመራማሪዎች እና ኩባንያዎች ቀደም ሲል JAX፣ MaxText፣ NVIDIA ጂፒዩዎች እና ባለብዙ ጂፒዩ ወይም ባለብዙ መስቀለኛ መንገድ መሠረተ ልማት ይጠቀማሉ። ምንጩ ተመሳሳይ ትርፍ ለትንንሽ ስርዓቶች፣ NVIDIA ላልሆኑ ሃርድዌር፣ ጥቅጥቅ ያሉ ሞዴሎች ወይም የስራ ጫናዎች ከዘገበው DeepSeek-V3 ውቅር ውጭ እንደሚተገበር አላረጋገጠም።

የNVIDIA አኃዞች እንደ አቅራቢ ሪፖርት የተደረጉ የአፈጻጸም ይገባኛል ጥያቄዎች መታየት አለባቸው። ምንጩ ከእያንዳንዱ ማመቻቸት ምን ያህል ማሻሻያ እንደሚመጣ ለማወቅ ምንም ገለልተኛ ሙከራዎችን፣ ዝርዝር የወጪ ትንተና ወይም ሙሉ ዘዴ አያቀርብም።

Interactive Mechanism

በይነተገናኝ ሜካኒዝም፡ በትክክል እንዴት እንደሚሰራ

ከዚህ ልማት በስተጀርባ ያለውን ቴክኖሎጂ በይነተገናኝ ያስሱ።

Document Size:128K tokens
Needle Placement Depth (Location in document):50% into text
Attention Context Buffer Map:
Target Fact (50%)
Equivalent Pages~320Standard book pages
Retrieval Accuracy99.9%Needle recall score
RAM / KV Cache5.1 GBMemory overhead
Prompt CachingActive~80% discount on reuse
Core takeaway: Million-token context windows allow querying whole codebases or legal archives in one prompt. However, KV cache memory scales with context length, making prompt caching crucial for real-time production.
በይነተገናኝ ጽንሰ-ሐሳብ ቼክ+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

ቀጥሎ ምን እንደሚታይ

ዋናው ጥያቄ የተዘገበው ግኝቶች በተለያዩ የሞኢ አርክቴክቸር፣ የክላስተር አቀማመጦች፣ የሞዴል መጠኖች እና የጂፒዩ ትውልዶች ይባዛሉ ወይ የሚለው ነው። NVIDIA NVFP4 ለመጨመር አቅዷል፣ ከ GEMM ጋር የተዋሃደ መጠን እና ተጨማሪ ሁሉንም-ለ-ሁሉም መደራረብ። ተጠቃሚዎች እንዲሁም እነዚህ ባህሪያት በJAX እና MaxText የስራ ፍሰቶች ውስጥ መደበኛ መሆናቸውን እና ማሻሻያዎቹ ከፍተኛ ሞዴል-ተኮር ማስተካከያ የሚያስፈልጋቸው መሆን አለመሆኑን መመልከት አለባቸው። ምንጩ በኮንቴይነር ላይ የተመሰረተ የመዳረሻ ዱካንን ይመዘግባል ነገር ግን የዋጋ አሰጣጥን፣ የፍቃድ አሰጣጥ ውሎችን፣ የድጋፍ ቁርጠኝነትን፣ ወይም አጠቃላይ ተገኝነትን ከተጠቀሰው የNGC መያዣ በላይ አይገልጽም።

በሌሎች የMoE ሞዴሎች እና የሃርድዌር አወቃቀሮች ላይ መባዛት የተዘገበው ጥቅማጥቅሞች በስፋት የሚተላለፉ መሆናቸውን ወይም ከDeepSeek-V3 እና NVIDIA ክላስተር ማዋቀር ጋር የተጣመሩ መሆናቸውን ያሳያል።

NVIDIA ወደፊት ሥራ NVFP4፣ የተዋሃደ መጠን ከ GEMM ጋር እና ተጨማሪ ሁሉንም-ለሁሉም መደራረብን ይጨምራል ይላል። እነዚያ ተጨማሪዎች የቁልል አፈጻጸምን እና የማስታወስ ችሎታን የበለጠ ሊጎዱ ይችላሉ።

ምንጩ የእርምጃ ጊዜን፣ TFLOPS በጂፒዩ፣ የሞዴል FLOP አጠቃቀምን፣ የቡድን GEMM መዘግየትን እና የመላክ/ጥምር መዘግየትን መከታተልን ይመክራል። እነዚያ መለኪያዎች ግኝቶችን ከግንኙነት ማሻሻያዎች ለመለየት ይረዳሉ።

ልጥፉ የመያዣውን ዋጋ፣ የፍቃድ አሰጣጥ ሁኔታዎችን፣ የድጋፍ ደረጃን፣ ወይም ሁሉም የተጠቀሱ አካላት ለምርት አጠቃቀም እኩል የበሰሉ መሆናቸውን አይገልጽም።

ተዛማጅ መመሪያዎች እና ጥያቄዎች

AI ሞዴሎች ተብራርተዋልትራንስፎርመሮችAI ስልጠናየAI መጪው ጊዜየሚያውቁትን ይሞክሩ - ነፃ የ AI ጥያቄዎችን ይሞክሩበእኛ የቃላት መፍቻ ውስጥ የ AI ቃልን ይፈልጉየ AI ሞዴል መልቀቂያ መከታተያ ይከተሉ
ይህ ጠቃሚ ሆኖ ተገኝቷል?