PRZEWODNIK techniczny

Stosy szkoleniowe DeepSpeed i Megatron

DeepSpeed (Microsoft) i Megatron-LM (NVIDIA) to stosy oprogramowania, które sprawiają, że modele szkoleniowe z miliardami parametrów na tysiącach procesorów graficznych są rzeczywiście wykonalne.

2 minuty czytaniaOstatnia aktualizacja

Przegląd

Without them, today's frontier models simply could not fit in memory or finish training in a reasonable time.

Głębokie nurkowanie

Uczenie dużego modelu na jednym GPU jest niemożliwe, ponieważ wagi, gradienty i stany optymalizatora nie pasują. Te stosy dzielą pracę na wiele procesorów graficznych. Megatron-LM jest pionierem równoległości tensorów, dzieląc indywidualne mnożenia macierzy w każdej warstwie na procesorach graficznych, a także równoległość potoków, która umieszcza różne warstwy na różnych procesorach graficznych. Charakterystycznym wkładem DeepSpeed ​​jest ZeRO (Zero Redundancy Optimizer), który oddziela stany optymalizatora, gradienty i parametry pomiędzy procesorami graficznymi zamiast je replikować, radykalnie zmniejszając pamięć przypadającą na procesor graficzny. Obydwa są często łączone (Megatron-DeepSpeed) w celu szkolenia modeli takich jak BLOOM-176B i Megatron-Turing NLG. Dodają także mieszaną precyzję, punkty kontrolne aktywacji i odciążanie procesora lub NVMe, dzięki czemu ogromne modele działają na ograniczonym sprzęcie.

Wgląd techniczny

ZeRO ma trzy etapy zwiększania oszczędności pamięci: etap 1 fragmentuje stany optymalizatora, etap 2 również fragmentuje gradienty, a etap 3 dzieli się na same parametry, zbierając je na żądanie podczas przejść do przodu i do tyłu. W połączeniu z równoległością tensorów (wewnątrzwarstwową) i równoległością potoku (międzywarstwową) tworzy to „równoległość 3D”. Kluczowym problemem jest narzut komunikacyjny: każdy podział fragmentu zwiększa ruch między procesorami graficznymi, więc inżynierowie dostosowują podział, aby zapewnić nasycenie szybkich łączy NVLink i InfiniBand.

Wpływ strategiczny

Koszt i budżet

Decyzje dotyczące architektury wpływają na wydajność i koszty operacyjne przez lata.

Jaśniejsze decyzje

Edukacja techniczna pomaga zespołom wybrać odpowiedni stos, a nie tylko najnowszy.

Kontrola jakości

Lepsze wybory inżynieryjne zmniejszają liczbę incydentów związanych z niezawodnością w produkcji.

Przyszłość stosów szkoleniowych DeepSpeed i Megatron

Spodziewaj się ściślejszej integracji z natywnym FSDP (Fully Sharded Data Parallel) PyTorch, który wchłonął wiele pomysłów ZeRO, zacierając granicę między stosami badawczymi a podstawowymi frameworkami. Podejścia oparte na kompilatorze i automatyczne planowanie równoległości mają na celu wyeliminowanie ręcznego dostrajania. W miarę jak klastry szkoleniowe rozrastają się do setek tysięcy akceleratorów, tolerancja na błędy, elastyczne skalowanie i nakładająca się komunikacja z obliczeniami stają się dominującymi granicami inżynierii, obok obsługi nowego sprzętu, takiego jak NVIDIA Blackwell i niestandardowych układów szkoleniowych.

Implementacja w świecie rzeczywistym

Szkolenie otwartego, wielojęzycznego modelu BLOOM-176B przy użyciu połączonego stosu Megatron-DeepSpeed ​​na setkach procesorów graficznych.

Microsoft i NVIDIA szkolą model Megatron-Turing NLG o 530 miliardach parametrów z równoległością 3D.

ZeRO-Offload umożliwia naukowcom dostrajanie wielomiliardowych modeli na procesorze graficznym pojedynczej stacji roboczej poprzez przeniesienie stanów optymalizatora do pamięci RAM procesora.

Używanie punktów kontrolnych aktywacji w tych stosach, aby dopasować dłuższe okna kontekstowe poprzez ponowne obliczenie aktywacji zamiast przechowywania ich wszystkich.

Zagrożenia i poręcze

Optymalizacja jednego testu porównawczego może ukryć szersze słabości systemu.

Koszty infrastruktury i utrzymania są często niedoszacowane.

W miarę jak systemy stają się coraz bardziej złożone, luki w bezpieczeństwie i obserwowalności mogą się zwiększać.

Plan wdrożenia

1

Przed wdrożeniem zdefiniuj docelowe opóźnienia, jakość i koszty.

2

Test porównawczy w realistycznych warunkach obciążenia i danych.

3

Monitorowanie przyrządu pod kątem błędów, dryftu i wpływu użytkownika.

4

Przed skalowaniem przygotuj ścieżki wycofywania zmian i reakcji na incydenty.

Odkrywaj dalej

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the DeepSpeed and Megatron Training Stacks quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Rozpocznij quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Następny poradnik

Kwantyzacja potreningowa GPTQ i AWQ

Często zadawane pytania

What is DeepSpeed and Megatron Training Stacks?

DeepSpeed (Microsoft) i Megatron-LM (NVIDIA) to stosy oprogramowania, które sprawiają, że modele szkoleniowe z miliardami parametrów na tysiącach procesorów graficznych są rzeczywiście wykonalne. Bez nich dzisiejsze modele z pogranicza po prostu nie mogłyby zmieścić się w pamięci ani ukończyć treningu w rozsądnym czasie.

Jaki jest główny cel optymalizatora ZeRO firmy DeepSpeed?

ZeRO (Zero Redundancy Optimizer) eliminuje nadmiarowość pamięci poprzez partycjonowanie stanów, gradientów i parametrów optymalizatora pomiędzy procesorami graficznymi, zamiast replikować je na każdym urządzeniu.

W jaki sposób równoległość tensorowa, zapoczątkowana w Megatron-LM, dzieli model?

Równoległość tensorów dzieli matematykę na pojedynczą warstwę (np. mnożenie dużej macierzy) na wiele procesorów graficznych, co jest podziałem wewnątrzwarstwowym.

Który stopień ZeRO zapewnia największą oszczędność pamięci, dzieląc również same parametry modelu?

ZeRO Stage 3 oddziela parametry oprócz gradientów i stanów optymalizatora, zbierając je na żądanie, co zapewnia największą redukcję pamięci.

W jaki sposób „punkt kontrolny aktywacji” pomaga oszczędzać pamięć podczas treningu?

Punkt kontrolny aktywacji przechowuje mniej aktywacji pośrednich i ponownie je oblicza podczas propagacji wstecznej, zamieniając dodatkowe obliczenia na zmniejszoną pamięć.

Dlaczego łączenie tych technik często nazywane jest „równoległością 3D”?

Równoległość 3D łączy w sobie trzy strategie ortogonalne: równoległość danych, równoległość tensorową (wewnątrzwarstwową) i równoległość potokową (międzywarstwową).