Назад към Новини
ИновацияAI Understanding брифинг

NVIDIA съобщава за 10 пъти по-бързо MoE обучение без капки в JAX

NVIDIA казва, че неговите оптимизации на Transformer Engine и JAX са увеличили производителността на обучението на DeepSeek-V3 671B с около 10 пъти и са постигнали 97% ефективност в 1024 GPU. Оптимизираният път е включен в NVIDIA NGC MaxText контейнер с дата 9 септември 2026 г. или по-нова.

4 min readRead the primary source
Source-provided image accompanying NVIDIA reports 10x faster dropless MoE training in JAX
Документ с първичен източникИзточникът е записан
Издател
developer.nvidia.com
Изходна връзка
developer.nvidia.comhttps://developer.nvidia.com/blog/accelerating-dropless-moe-training-in-jax-with-nvidia-transformer-engine/
Тип източник
Първичен документ — официално съобщение, документ, документ или първа страна, която четем директно.
КонтекстРазберете това за 60 секунди

Започнете тук

Ключови термини

Смес от експерти (MoE)
Архитектура със специализирани подмрежи, където само избрани експерти работят на вход.
Памет (памет на агент)
Съхраненият контекст, който AI агент използва през стъпките или сесиите, за да подобри непрекъснатостта.
Квантуване
Преобразуване на теглата на модела във формати с по-ниска точност, като 8-битов или 4-битов.
Тествайте себе сиТест за обяснение на AI модели

Какво стана

NVIDIA описва набор от оптимизации на JAX и Transformer Engine за обучение за смесване на експерти без капки, включително групиран GEMM, слети експертно-паралелни операции за изпращане и комбиниране, NCCL EP, XLA многопоточни колективи, MXFP8 групирано квантуване и разтоварване при активиране на хост. Компанията казва, че неоптимизирана базова линия за обучение на DeepSeek-V3 е достигнала 103 TFLOPS на GPU, в сравнение с 1068 TFLOPS на GPU след оптимизация, и тази производителност от край до край се е подобрила с около 10 пъти. NVIDIA също отчита 97% ефективност на мащабиране при 1024 GPU. Оптимизираните компоненти са включени в контейнера NVIDIA NGC MaxText, с инструкции за тестване и възпроизвеждане на конфигурацията.

Публикацията на NVIDIA се фокусира върху обучението за смесване на експерти без капки, при което всеки токен се обработва от избрания от него експерт, дори когато маршрутизирането създава неравномерни експертни натоварвания. За разлика от подходите, базирани на капацитет, които отрязват препълването или подложките на експертите до фиксирани размери, обучението без капки изисква ядра и комуникационни пътища за обработка на променлив брой токени. NVIDIA казва, че тези неправилни форми произвеждат накъсани тензори и могат да оставят графичните процесори да чакат изпращане, комуникация между всички и експертни изчисления.

Докладваните промени действат на няколко слоя. Групираният GEMM на Transformer Engine обработва експертни групи с променлива дължина в едно извикване на ядрото, докато обединява операциите за изпращане и комбиниране и преместването на адреса на бекенда на NCCL EP на токени между GPU. NVIDIA също така цитира XLA многопоточни колективи, разтоварване при активиране на хост и групирано квантуване MXFP8 като допринасящи за резултата.

Компанията съобщава, че нейната конфигурация DeepSeek-V3 671B е повишила базовата линия от 103 на 1068 TFLOPS на GPU и е довела до приблизително 10x увеличение на пропускателната способност от край до край. Той също така отчита 97% ефективност при 1024 GPU. Тези цифри са представени от NVIDIA като наблюдения от неговия оптимизиран стек, а не като независимо проверени резултати.

Внедряването е достъпно за изпробване чрез контейнера NVIDIA NGC MaxText с вграден Transformer Engine. Публикацията уточнява ghcr.io/nvidia/jax:maxtext-2026-09-09 или по-нова и предоставя насоки за конфигурация за DeepSeek-V3. Той предупреждава, че различните модели изискват различна настройка. Подробности за цената и лиценза не са предоставени.

Детайли за източника: developer.nvidia.com ↗

Защо има значение

Големите смесени експертни модели намаляват изчисленията чрез активиране само на избрани експертни мрежи, но тяхното неравномерно маршрутизиране на токени създава трудна комуникация и тесни места в паметта. Ако резултатите на NVIDIA се задържат отвъд докладваната конфигурация, промените биха могли да направят обучението на много големи системи на MoE по-ефективно, без да изпускат маршрутизирани токени или да добавят всеки експерт до фиксиран капацитет. Това има значение предимно за организации, работещи с големи NVIDIA GPU клъстери, където комуникационните разходи и загубата на изчисления могат съществено да повлияят на времето и разходите за обучение. Резултатите са собствени твърдения на NVIDIA; източникът не предоставя независим бенчмаркинг или сравнение с всяка алтернативна реализация.

Обучението на MoE е все по-важно за големите AI модели, тъй като условното изчисление може да намали активното изчисление на токен, като същевременно запазва много параметри. Инженерната трудност се измества към маршрутизиране, нерегулярни матрични операции, използване на паметта и междусистемен трафик. Подобряването на тези части може да намали времето и хардуера, необходими за обучение на модели в производствен мащаб.

Практическата публика е специализирана: изследователи и компании, които вече използват JAX, MaxText, NVIDIA графични процесори и инфраструктура с няколко графични процесора или много възли. Източникът не установява, че същите печалби се прилагат за по-малки системи, не-NVIDIA хардуер, плътни модели или работни натоварвания извън отчетената DeepSeek-V3 конфигурация.

Цифрите на NVIDIA трябва да се третират като претенции за ефективност, докладвани от доставчика. Източникът не предоставя независими тестове, подробен анализ на разходите или пълна методология, достатъчна да определи каква част от подобрението идва от всяка оптимизация.

Interactive Mechanism

Интерактивен механизъм: как всъщност работи

Разгледайте интерактивно основната технология зад тази разработка.

Document Size:128K tokens
Needle Placement Depth (Location in document):50% into text
Attention Context Buffer Map:
Target Fact (50%)
Equivalent Pages~320Standard book pages
Retrieval Accuracy99.9%Needle recall score
RAM / KV Cache5.1 GBMemory overhead
Prompt CachingActive~80% discount on reuse
Core takeaway: Million-token context windows allow querying whole codebases or legal archives in one prompt. However, KV cache memory scales with context length, making prompt caching crucial for real-time production.
Интерактивна проверка на концепцията+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Какво да гледате след това

Основният въпрос е дали отчетените печалби се възпроизвеждат в различни архитектури на MoE, оформления на клъстери, размери на модели и поколения GPU. NVIDIA планира да добави NVFP4, квантуване, съчетано с GEMM, и допълнително припокриване на всички към всички. Потребителите също трябва да следят дали тези функции стават стандартни в работните потоци JAX и MaxText и дали оптимизациите изискват значителна настройка, специфична за модела. Източникът документира базиран на контейнер път за достъп, но не посочва цени, лицензионни условия, ангажименти за поддръжка или обща наличност извън цитирания NGC контейнер.

Възпроизвеждането в други модели на MoE и хардуерни конфигурации ще покаже дали отчетените печалби са широко преносими или тясно свързани с настройката на клъстера на DeepSeek-V3 и NVIDIA.

NVIDIA казва, че бъдещата работа ще добави NVFP4, слято квантуване с GEMM и допълнително припокриване на всички към всички. Тези допълнения биха могли допълнително да повлияят на компромисите в производителността и паметта на стека.

Източникът препоръчва проследяване на времето за стъпка, TFLOPS на GPU, използване на FLOP на модела, групирана латентност на GEMM и латентност на изпращане/комбиниране. Тези измервания ще помогнат да се отделят изчислителните печалби от подобренията в комуникацията.

Публикацията не посочва цената на контейнера, условията за лицензиране, нивото на поддръжка или дали всички цитирани компоненти са еднакво зрели за производствена употреба.

Свързани ръководства и викторини

Обяснени модели на AIТрансформърсAI обучениеБъдещето на ИИТествайте какво знаете — опитайте безплатен тест с изкуствен интелектПотърсете термин за AI в нашия речникСледвайте програмата за проследяване на пускането на AI модел
Намирате ли това за полезно?