Komawa Labarai
Bidi'aAI Understanding takaitaccen bayani

NVIDIA yana ba da rahoton horon MoE mai sauri 10x a cikin JAX

NVIDIA ya ce Injin Canjin sa da haɓakawa na JAX sun haɓaka aikin horarwa na DeepSeek-V3 671B da kusan 10x kuma ya sami inganci 97% a cikin 1,024 GPUs. An haɗa ingantaccen hanyar a cikin akwati NVIDIA NGC MaxText mai kwanan wata Satumba 9, 2026, ko kuma sabo.

4 min readRead the primary source
Source-provided image accompanying NVIDIA reports 10x faster dropless MoE training in JAX
Takardun tushe na farkoAn rubuta tushen tushe
Mawallafi
developer.nvidia.com
Tushen hanyar haɗin gwiwa
developer.nvidia.comhttps://developer.nvidia.com/blog/accelerating-dropless-moe-training-in-jax-with-nvidia-transformer-engine/
Nau'in tushe
Takardun farko - sanarwar hukuma, takarda, yin rajista, ko shafi na farko da muka karanta kai tsaye.
MaganaFahimtar wannan a cikin daƙiƙa 60

Fara a nan

Mabuɗin sharuddan

Cakudar Masana (MoE)
Ginin gine-gine tare da ƙananan hanyoyin sadarwa na musamman inda ƙwararrun zaɓaɓɓu kawai ke gudana kowace shigarwa.
Ƙwaƙwalwar ajiya (Agent Memory)
Mahallin da aka adana wani wakilin AI yana amfani da matakai ko zaman don inganta ci gaba.
Ƙididdigewa
Mayar da ma'aunin ƙira zuwa ƙananan madaidaicin tsari kamar 8-bit ko 4-bit.
Gwada kankaAI Model An Bayyana Tambayoyi

Me ya faru

NVIDIA yana bayyana saitin ingantattun ingin JAX da Injin Mai Canjawa don horarwar ƙwararrun masana, gami da rukunin GEMM, haɗaɗɗen ƙwararrun ƙwararrun ƙwararru da haɗa ayyukan, NCCL EP, ƙungiyoyin multistream XLA, MXFP8 ƙungiyar ƙididdigewa, da saukar da saukar da runduna. Kamfanin ya ce tushen horo na DeepSeek-V3 wanda ba a inganta shi ba ya kai 103 TFLOPS a kowace GPU, idan aka kwatanta da 1,068 TFLOPS a kowane GPU bayan ingantawa, kuma abin da aka samu daga ƙarshe zuwa ƙarshen ya inganta da kusan 10x. NVIDIA kuma yana ba da rahoton ingancin ƙimar 97% a 1,024 GPUs. Abubuwan da aka inganta sun haɗa a cikin akwatin NVIDIA NGC MaxText, tare da umarni don gwaji da sake sake fasalin.

Matsayin NVIDIA yana mai da hankali kan horarwar ƙwararrun masana, wanda kowane ƙwararren ƙwararren da aka zaɓa ke sarrafa kowane alama ko da lokacin tuƙi yana haifar da nauyin ƙwararru marasa daidaituwa. Ba kamar hanyoyin tushen ƙarfi waɗanda ke datse ambaliya ko ƙwararrun ƙwanƙwasa zuwa ƙayyadaddun masu girma dabam, horarwar da ba ta da ruwa tana buƙatar kernels da hanyoyin sadarwa don ɗaukar ƙididdiga masu canzawa. NVIDIA ya ce waɗannan sifofi marasa tsari suna haifar da ƙwanƙwasawa kuma suna iya barin GPUs suna jiran aikawa, duk-zuwa-dukkan sadarwa, da ƙididdigar ƙwararru.

Canje-canjen da aka ruwaito suna aiki a yadudduka da yawa. Rukunin Injin Transformer GEMM yana aiwatar da ƙungiyoyin ƙwararrun ƙwararru masu tsayi a cikin kiran kwaya ɗaya, yayin da aka haɗa aikawa da haɗa ayyuka da motsin adireshin baya na NCCL EP na alamun tsakanin GPUs. NVIDIA kuma ya ambaci ƙungiyoyin XLA masu yawa, saukar da kunnawa mai watsa shiri, da ƙididdige rukuni na MXFP8 azaman masu ba da gudummawa ga sakamakon.

Kamfanin ya ba da rahoton cewa tsarin sa na DeepSeek-V3 671B ya haɓaka tushe daga 103 zuwa 1,068 TFLOPS a kowace GPU kuma ya samar da kusan 10x ƙarshen-zuwa-ƙarshen ribar kayan aiki. Hakanan yana ba da rahoton ingancin 97% a 1,024 GPUs. NVIDIA ne ya gabatar da waɗannan alkaluman a matsayin abubuwan lura daga ingantattun tarin sa, ba kamar yadda aka tabbatar da sakamakon da kansa ba.

Ana aiwatar da aiwatarwa don gwadawa ta hanyar NVIDIA NGC MaxText kwandon tare da Injin Mai Canjawa wanda aka gina a ciki. Matsayin ya ƙayyade ghcr.io/nvidia/jax:maxtext-2026-09-09 ko sabo kuma yana ba da jagorar daidaitawa don DeepSeek-V3. Yana lura cewa nau'ikan nau'ikan daban-daban suna buƙatar kunna daban-daban. Ba a bayar da bayanan farashi da lasisi ba.

Bayanan tushe: developer.nvidia.com ↗

Me ya sa yake da mahimmanci

Manya-manyan nau'ikan ƙwararrun masana suna rage ƙididdiga ta hanyar kunna zaɓaɓɓun cibiyoyin sadarwa na ƙwararru, amma rashin daidaituwar alamarsu yana haifar da wahalan sadarwa da ƙullawar ƙwaƙwalwa. Idan sakamakon NVIDIA ya riƙe fiye da tsarin da aka bayar da rahoton, sauye-sauyen na iya sa horon manyan tsarin MoE ya fi dacewa ba tare da sauke alamun da aka lalata ba ko sanya kowane ƙwararru zuwa ƙayyadaddun iya aiki. Wannan yana da mahimmanci ga ƙungiyoyi masu aiki da manyan gungu na NVIDIA GPU, inda sadarwa sama da ɓatanci na iya shafar lokacin horo da tsadar gaske. Sakamakon da'awar NVIDIA ne; Madogararsa baya bayar da ƙima mai zaman kanta ko kwatancen kowane aikace-aikacen madadin.

Horon MoE yana ƙara mahimmanci ga manyan samfuran AI saboda ƙididdigewa na sharadi na iya rage ƙididdige ƙididdiga ta kowace alama yayin riƙe da sigogi da yawa. Wahalhalun injiniyan yana ƙaura zuwa hanyar tuƙi, ayyukan matrix marasa tsari, amfani da ƙwaƙwalwar ajiya, da zirga-zirgar haɗin gwiwa. Inganta waɗancan sassan na iya rage lokaci da kayan aikin da ake buƙata don horar da ƙira a sikelin samarwa.

Masu sauraro masu amfani sun ƙware: masu bincike da kamfanoni sun riga sun yi amfani da JAX, MaxText, NVIDIA GPUs, da GPUs da yawa ko kayan aikin kumburi. Madogararsa ba ta tabbatar da cewa ribar iri ɗaya ta shafi ƙananan tsarin ba, kayan aikin da ba na NVIDIA ba, ƙira mai yawa, ko kayan aiki a wajen daidaitawar DeepSeek-V3 da aka ruwaito.

alkalumman NVIDIA yakamata a kula dasu azaman iƙirarin aikin da mai siyarwa ya ruwaito. Madogararsa ba ta samar da gwaje-gwaje masu zaman kansu, cikakken bincike na farashi, ko cikakkiyar dabarar da ta isa ta tantance adadin haɓakar da ke fitowa daga kowane haɓakawa.

Interactive Mechanism

Ingantacciyar hanyar sadarwa: Yadda A zahiri yake Aiki

Bincika fasahar da ke bayan wannan ci gaban ta hanyar mu'amala.

Document Size:128K tokens
Needle Placement Depth (Location in document):50% into text
Attention Context Buffer Map:
Target Fact (50%)
Equivalent Pages~320Standard book pages
Retrieval Accuracy99.9%Needle recall score
RAM / KV Cache5.1 GBMemory overhead
Prompt CachingActive~80% discount on reuse
Core takeaway: Million-token context windows allow querying whole codebases or legal archives in one prompt. However, KV cache memory scales with context length, making prompt caching crucial for real-time production.
Duba ra'ayi na hulɗa+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Abin kallo na gaba

Babbar tambayar ita ce ko ribar da aka ruwaito ta haifuwa a cikin gine-ginen MoE daban-daban, tsarin tari, girman samfuri, da tsararrun GPU. NVIDIA yana shirin ƙara NVFP4, ƙididdigewa da aka haɗa tare da GEMM, da ƙarin haɗin kai-zuwa-duka. Hakanan ya kamata masu amfani su kalli ko waɗannan fasalulluka sun zama daidaitattun a cikin ayyukan aiki na JAX da MaxText, kuma ko haɓakawa suna buƙatar takamaiman takamaiman ƙirar ƙira. Tushen yana ba da bayanin hanyar samun damar tushen kwantena amma baya faɗi farashin farashi, sharuɗɗan lasisi, alkawurran tallafi, ko wadatar gabaɗaya fiye da kwandon NGC da aka ambata.

Sakewa a cikin sauran samfuran MoE da daidaitawar kayan masarufi zai nuna ko ribar da aka ruwaito ana iya canjawa wuri gabaɗaya ko kuma an haɗa ta sosai zuwa DeepSeek-V3 da NVIDIA's cluster saitin.

NVIDIA ya ce aiki na gaba zai ƙara NVFP4, ƙididdige ƙididdigewa tare da GEMM, da ƙarin haɗin kai gabaɗaya. Wadancan abubuwan kari na iya kara shafar aiki da cinikin ƙwaƙwalwar ajiya na tari.

Madogarar tana ba da shawarar bin lokacin mataki, TFLOPS kowane GPU, yin amfani da samfurin FLOP, latency na GEMM da aka haɗa, da aikawa/haɗa latency. Waɗancan ma'aunai za su taimaka raba lissafin riba daga ingantattun sadarwa.

Sakon baya bayyana farashin kwantena, yanayin lasisi, matakin tallafi, ko duk abubuwan da aka ambata sun balaga daidai da amfanin samarwa.

Jagorori masu alaƙa & tambayoyin tambayoyi

AI Model ya bayyanaMasu canjiAI horoMakomar AIGwada abin da kuka sani - gwada gwajin AI kyautaNemo kalmar AI a cikin ƙamus ɗin muBi samfurin AI na sakin tracker
An sami wannan yana da amfani?