Pada si Iroyin
AtunseAI Understanding finifini

NVIDIA ṣe ijabọ 10x ikẹkọ MoE ti ko silẹ ni iyara ni JAX

NVIDIA sọ pe Ẹrọ Ayipada rẹ ati awọn iṣapeye JAX pọ si ilọjade ikẹkọ DeepSeek-V3 671B nipa bii 10x ati pe o ṣaṣeyọri 97% ṣiṣe kọja 1,024 GPUs. Ọna iṣapeye naa wa ninu apo NVIDIA NGC MaxText kan ti o dati Oṣu Kẹsan Ọjọ 9, Ọdun 2026, tabi tuntun.

4 min readRead the primary source
Source-provided image accompanying NVIDIA reports 10x faster dropless MoE training in JAX
Iwe aṣẹ orisun akọkọOrisun ti o gbasilẹ
Olutẹwe
developer.nvidia.com
Orisun ọna asopọ
developer.nvidia.comhttps://developer.nvidia.com/blog/accelerating-dropless-moe-training-in-jax-with-nvidia-transformer-engine/
Orisun iru
Iwe akọkọ - ikede osise, iwe, iforukọsilẹ, tabi oju-iwe ẹgbẹ akọkọ ti a ka taara.
AtokọLoye eyi ni iṣẹju 60

Bẹrẹ nibi

Awọn ofin bọtini

Apapọ Awọn amoye (MoE)
Ohun faaji pẹlu specialized subnetworks ibi ti nikan ti a ti yan amoye nṣiṣẹ fun igbewọle.
Iranti (Iranti Aṣoju)
Ọgangan ipamọ ti o jẹ aṣoju AI nlo kọja awọn igbesẹ tabi awọn akoko lati mu ilọsiwaju sii.
Iṣiro
Yiyipada awọn iwọn awoṣe si awọn ọna kika konge kekere bi 8-bit tabi 4-bit.
Ṣe idanwo fun ara rẹAwọn awoṣe AI ti ṣalaye adanwo

Kini o ṣẹlẹ

NVIDIA ṣapejuwe eto ti JAX ati Awọn iṣapeye ẹrọ Transformer fun ikẹkọ idapọ-ti awọn amoye, pẹlu GEMM ti o ṣajọpọ, ifiranšẹ alamọja ti o jọmọ ati apapọ awọn iṣẹ ṣiṣe, NCCL EP, XLA multistream collectives, MXFP8 grouped , and hosting hosting offloading. Ile-iṣẹ naa sọ pe ipilẹ ikẹkọ DeepSeek-V3 ti ko ni ilọsiwaju ti de 103 TFLOPS fun GPU, ni akawe pẹlu 1,068 TFLOPS fun GPU lẹhin iṣapeye, ati pe igbejade ipari-si-opin ni ilọsiwaju nipasẹ iwọn 10x. NVIDIA tun ṣe ijabọ 97% ṣiṣe igbelowọn ni 1,024 GPUs. Awọn paati iṣapeye ti wa ninu apoti NVIDIA NGC MaxText, pẹlu awọn ilana fun idanwo ati atunto atunto.

Ifiweranṣẹ NVIDIA dojukọ ikẹkọ idapọ-ti awọn alamọja ti ko ni silẹ, ninu eyiti gbogbo ami-ami ti ni ilọsiwaju nipasẹ alamọja ti o yan paapaa nigbati ipa-ọna n ṣẹda awọn ẹru iwé ti ko ni deede. Ko dabi awọn isunmọ ti o da lori agbara ti gige iṣan omi tabi awọn amoye paadi si awọn iwọn ti o wa titi, ikẹkọ aibikita nilo awọn kernels ati awọn ọna ibaraẹnisọrọ lati mu awọn iṣiro ami oniyipada. NVIDIA sọ pe awọn apẹrẹ alaibamu wọnyi ṣe agbejade awọn tenors ragged ati pe o le fi awọn GPU duro lori fifiranṣẹ, gbogbo-si-gbogbo ibaraẹnisọrọ, ati iṣiro iwé.

Awọn iyipada ti a royin ṣiṣẹ ni awọn ipele pupọ. Ayipada Engine ti a ṣe akojọpọ GEMM awọn ilana awọn ẹgbẹ alamọdaju gigun-iyipada ni ipe ekuro kan, lakoko ti o dapọ ati ṣajọpọ awọn iṣẹ ṣiṣe ati iṣipopada adirẹsi NCCL EP ti awọn ami laarin awọn GPUs. NVIDIA tun tọka awọn akojọpọ multistream XLA, ikojọpọ imuṣiṣẹ agbalejo, ati titobi akojọpọ MXFP8 bi awọn oluranlọwọ si abajade naa.

Ile-iṣẹ naa ṣe ijabọ pe iṣeto DeepSeek-V3 671B rẹ pọ si ipilẹ kan lati 103 si 1,068 TFLOPS fun GPU ati ṣe agbejade isunmọ 10x ipari-si-opin ere igbejade. O tun ṣe ijabọ ṣiṣe 97% ni 1,024 GPUs. Awọn isiro wọnyi jẹ afihan nipasẹ NVIDIA bi awọn akiyesi lati akopọ iṣapeye rẹ, kii ṣe bi awọn abajade idaniloju ominira.

Awọn imuse wa lati gbiyanju nipasẹ NVIDIA NGC MaxText eiyan pẹlu Transformer Engine ti a ṣe sinu. Ifiranṣẹ naa pato ghcr.io/nvidia/jax:maxtext-2026-09-09 tabi titun ati pese itọnisọna iṣeto ni fun DeepSeek-V3. O ṣe akiyesi pe awọn awoṣe oriṣiriṣi nilo iyipada oriṣiriṣi. Ifowoleri ati awọn alaye iwe-aṣẹ ko pese.

Awọn alaye orisun: developer.nvidia.com ↗

Kini idi ti o ṣe pataki

Awọn awoṣe adalu-ti-iwé nla dinku iṣiro nipa ṣiṣiṣẹ awọn nẹtiwọọki iwé ti a yan nikan, ṣugbọn ipa-ọna ami aiṣedeede wọn ṣẹda ibaraẹnisọrọ ti o nira ati awọn igo iranti. Ti awọn abajade NVIDIA ba duro kọja iṣeto ti a royin rẹ, awọn ayipada le jẹ ki ikẹkọ awọn eto MoE ti o tobi pupọ diẹ sii daradara laisi sisọ awọn ami ipalọlọ tabi padding gbogbo amoye si agbara ti o wa titi. Iyẹn ṣe pataki ni akọkọ si awọn ẹgbẹ ti n ṣiṣẹ awọn iṣupọ NVIDIA GPU nla, nibiti ibaraẹnisọrọ lori oke ati iṣiro asonu le ni ipa nipa ohun elo akoko ikẹkọ ati idiyele. Awọn abajade jẹ awọn ẹtọ ti ara NVIDIA; orisun ko pese aṣepari ominira tabi lafiwe pẹlu gbogbo imuse yiyan.

Ikẹkọ MoE jẹ pataki siwaju sii fun awọn awoṣe AI nla nitori iṣiro ipo le dinku iṣiro ti nṣiṣe lọwọ fun ami-ami lakoko ti o ni idaduro ọpọlọpọ awọn aye. Iṣoro imọ-ẹrọ n yipada si ọna ipa-ọna, awọn iṣẹ matrix alaibamu, lilo iranti, ati ijabọ ọna asopọ. Ilọsiwaju awọn ẹya yẹn le dinku akoko ati ohun elo ti o nilo lati ṣe ikẹkọ awọn awoṣe ni iwọn iṣelọpọ.

Awọn olugbo ti o wulo jẹ amọja: awọn oniwadi ati awọn ile-iṣẹ ti nlo JAX tẹlẹ, MaxText, NVIDIA GPUs, ati GPU-pupọ tabi awọn amayederun node-pupọ. Orisun naa ko fi idi rẹ mulẹ pe awọn anfani kanna kan si awọn eto kekere, ohun elo ti kii ṣe NVIDIA, awọn awoṣe ipon, tabi awọn iṣẹ ṣiṣe ni ita iṣeto DeepSeek-V3 ti a royin.

Awọn isiro NVIDIA yẹ ki o ṣe itọju bi awọn iṣeduro iṣẹ ṣiṣe ti olutaja. Orisun ko pese awọn idanwo ominira, alaye idiyele idiyele, tabi ilana kikun ti o to lati pinnu iye ilọsiwaju ti o wa lati iṣapeye kọọkan.

Interactive Mechanism

Ibaraẹnisọrọ Mechanism: Bii O Ṣe Nṣiṣẹ Lootọ

Ṣawari imọ-ẹrọ abẹlẹ lẹhin idagbasoke yii ni ibaraenisọrọ.

Document Size:128K tokens
Needle Placement Depth (Location in document):50% into text
Attention Context Buffer Map:
Target Fact (50%)
Equivalent Pages~320Standard book pages
Retrieval Accuracy99.9%Needle recall score
RAM / KV Cache5.1 GBMemory overhead
Prompt CachingActive~80% discount on reuse
Core takeaway: Million-token context windows allow querying whole codebases or legal archives in one prompt. However, KV cache memory scales with context length, making prompt caching crucial for real-time production.
Ibanisọrọ Erongba Ṣayẹwo+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Kini lati wo tókàn

Ibeere akọkọ ni boya awọn anfani ti a royin ṣe ẹda kọja oriṣiriṣi awọn ile ayaworan MoE, awọn ipilẹ iṣupọ, awọn iwọn awoṣe, ati awọn iran GPU. NVIDIA ngbero lati ṣafikun NVFP4, titobi dapọ pẹlu GEMM, ati afikun gbogbo-si-gbogbo ni lqkan. Awọn olumulo yẹ ki o tun wo boya awọn ẹya wọnyi di boṣewa ni JAX ati ṣiṣan iṣẹ MaxText, ati boya awọn iṣapeye nilo iṣatunṣe awoṣe-pataki. Orisun naa ṣe akosile ọna wiwọle orisun-eiyan ṣugbọn ko sọ idiyele idiyele, awọn ofin iwe-aṣẹ, awọn adehun atilẹyin, tabi wiwa gbogbogbo kọja apoti NGC ti a tọka.

Atunse kọja awọn awoṣe MoE miiran ati awọn atunto ohun elo yoo tọka boya awọn anfani ti o royin jẹ gbigbe lọpọlọpọ tabi ni wiwọ pọ si DeepSeek-V3 ati iṣeto iṣupọ NVIDIA.

NVIDIA sọ pe iṣẹ iwaju yoo ṣafikun NVFP4, titobi idapọ pẹlu GEMM, ati afikun gbogbo-si-gbogbo ni lqkan. Awọn afikun yẹn le ni ipa siwaju si iṣẹ ati awọn iṣowo iranti ti akopọ.

Orisun n ṣeduro akoko igbesẹ titele, TFLOPS fun GPU, iṣamulo FLOP awoṣe, aiṣiri GEMM ti a ṣe akojọpọ, ati fifiranṣẹ/darapọ idaduro. Awọn wiwọn wọnyẹn yoo ṣe iranlọwọ lọtọ awọn anfani iṣiro lati awọn ilọsiwaju ibaraẹnisọrọ.

Ifiweranṣẹ naa ko sọ idiyele eiyan naa, awọn ipo iwe-aṣẹ, ipele atilẹyin, tabi boya gbogbo awọn paati ti a mẹnuba jẹ dọgbadọgba fun lilo iṣelọpọ.

Awọn itọsọna ti o jọmọ & awọn ibeere

Awọn awoṣe AI ti ṣalayeAyirapadaAI IkẹkọỌjọ́ Iwájú AIṢe idanwo ohun ti o mọ — gbiyanju idanwo AI ọfẹ kanWa ọrọ AI kan ninu iwe-itumọ waTẹle olutọpa idasilẹ awoṣe AI
Ṣe eyi wulo?