DeepSpeed és Megatron Training Stackek
A DeepSpeed (Microsoft) és a Megatron-LM (NVIDIA) azok a szoftvercsomagok, amelyek több ezer GPU-n keresztül több milliárd paraméterrel rendelkező oktatási modelleket tesznek lehetővé.
Áttekintés
Without them, today's frontier models simply could not fit in memory or finish training in a reasonable time.
Mély merülés
Lehetetlen egy nagy modellt egyetlen GPU-n betanítani, mert a súlyok, a színátmenetek és az optimalizáló állapotai nem illenek egymáshoz. Ezek a veremek felosztják a munkát számos GPU között. A Megatron-LM úttörő szerepet játszott a tenzorpárhuzamban, az egyes mátrixszorzásokat feldarabolva minden egyes GPU-n belüli rétegben, valamint a csővezeték-párhuzamot, amely különböző rétegeket helyez a különböző GPU-kra. A DeepSpeed sajátossága a ZeRO (Zero Redundancy Optimizer), amely a GPU-k közötti optimalizálási állapotokat, gradienseket és paramétereket replikálja, ahelyett, hogy replikálná őket, így drámai módon csökkenti a GPU-nkénti memóriát. A kettőt gyakran kombinálják (Megatron-DeepSpeed), hogy olyan modelleket képezzenek, mint a BLOOM-176B és a Megatron-Turing NLG. Vegyes precizitást, aktiválási ellenőrzési pontot és kitöltést is hozzáadnak a CPU-hoz vagy az NVMe-hez, így a hatalmas modellek korlátozott hardveren edznek.
Technikai betekintés
A ZeRO három fokozatban növeli a memóriamegtakarítást: az 1. szakasz a szilánkok optimalizáló állapotait, a 2. szakasz a színátmeneteket is, a 3. szakasz pedig magát a paramétereket szilánkolja, és igény szerint összegyűjti azokat az előre- és visszalépés során. A tenzor párhuzamossággal (rétegen belüli) és csővezeték párhuzamossággal (rétegközi) kombinálva ez „3D párhuzamosságot” alkot. A fő feszültséget a kommunikációs költségek jelentik: minden szilánkfelosztás növeli a GPU-GPU forgalmat, így a mérnökök úgy hangolják a felosztást, hogy a gyors NVLink és InfiniBand kapcsolatok telítettek legyenek.
Stratégiai hatás
Költség és költségvetés
Az építészeti döntések évekig növelik a teljesítményt és a működési költségeket.
Tisztább döntések
A technikai oktatás segít a csapatoknak a megfelelő verem kiválasztásában, nem csak a legújabb készletben.
Minőségellenőrzés
A jobb mérnöki döntések csökkentik a termelés megbízhatósági incidenseit.
A DeepSpeed és a Megatron Training Stackek jövője
Szorosabb integrációra számíthat a PyTorch natív FSDP-jével (Fully Sharded Data Parallel), amely sok ZeRO-ötletet magába szívott, elmosva a határvonalat a kutatási veremek és az alapvető keretrendszerek között. A fordító által vezérelt megközelítések és az automatikus párhuzamossági tervezők célja a kézi hangolás eltávolítása. Ahogy a képzési klaszterek több százezer gyorsító felé nőnek, a hibatűrés, a rugalmas skálázás és a számításokkal való átfedő kommunikáció a domináns mérnöki határvonalakká válik, az új hardverek, például az NVIDIA Blackwell és az egyedi képzési chipek támogatása mellett.
Valós megvalósítás
A nyílt többnyelvű BLOOM-176B modell betanítása a kombinált Megatron-DeepSpeed verem segítségével több száz GPU-n keresztül.
Microsoft és az NVIDIA az 530 milliárd paraméterű Megatron-Turing NLG modellt 3D párhuzamossággal tanítja.
A ZeRO-Offload lehetővé teszi a kutatók számára, hogy egyetlen munkaállomás GPU-n finomhangolják a többmilliárd paraméterű modelleket az optimalizáló állapotainak a CPU RAM-ba való kiszórásával.
Aktiválási ellenőrzőpontok használata ezekben a veremekben a hosszabb kontextusablak beillesztéséhez az aktiválások újraszámításával az összes tárolása helyett.
Kockázatok és védőkorlátok
Egy benchmark optimalizálása elrejtheti a rendszer általános hiányosságait.
Az infrastrukturális és karbantartási költségeket gyakran alábecsülik.
A biztonsági és megfigyelhetőségi hiányosságok a rendszerek bonyolultabbá válásával nőhetnek.
Végrehajtási ütemterv
Határozza meg a késleltetési, minőségi és költségcélokat a megvalósítás előtt.
Benchmark reális terhelési és adatviszonyok mellett.
Műszerfigyelés a hibák, az eltolódás és a felhasználói hatások szempontjából.
A méretezés előtt készítse elő a visszagörgetési és az incidensre adott válaszútvonalakat.
Folytassa a felfedezést
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the DeepSpeed and Megatron Training Stacks quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Következő útmutató
GPTQ és AWQ edzés utáni kvantálás
Gyakran ismételt kérdések
What is DeepSpeed and Megatron Training Stacks?
A DeepSpeed (Microsoft) és a Megatron-LM (NVIDIA) azok a szoftvercsomagok, amelyek több ezer GPU-n keresztül több milliárd paraméterrel rendelkező oktatási modelleket tesznek lehetővé. Nélkülük a mai határmodellek egyszerűen nem férnének be a memóriába, és nem tudnának ésszerű időn belül befejezni az edzést.
Mi a DeepSpeed ZeRO optimalizálójának elsődleges célja?
A ZeRO (Zero Redundancy Optimizer) kiküszöböli a memóriaredundanciát azáltal, hogy particionálja az optimalizáló állapotait, gradienseit és paramétereit a GPU-k között, ahelyett, hogy az egyes eszközökön replikálná azokat.
A Megatron-LM-ben úttörő tenzorpárhuzam hogyan osztja meg a modellt?
A tenzorpárhuzam felosztja a matematikát egyetlen rétegen belül (például egy nagy mátrixszorzás) több GPU között, ami rétegen belüli felosztás.
Melyik ZeRO fokozat biztosítja a legnagyobb memóriamegtakarítást azáltal, hogy magukat a modellparamétereket is feldarabolja?
A ZeRO Stage 3 a színátmenetek és az optimalizáló állapotok mellett a paramétereket is megszilárdítja, igény szerint összegyűjti őket, így a legnagyobb memóriacsökkentést biztosítja.
Mit vált ki az „aktiválási ellenőrzőpont”, hogy memóriát takarítson meg edzés közben?
Az aktiválási ellenőrzőpontok kevesebb közbenső aktiválást tárolnak, és újraszámítják azokat a visszaterjesztés során, további számításokat keresve a csökkentett memóriaért.
Miért nevezik e technikák kombinálását gyakran „3D-s párhuzamosságnak”?
A 3D párhuzamosság három ortogonális stratégiát halmoz fel: adatpárhuzamot, tenzor (rétegen belüli) párhuzamosságot és csővezeték (rétegek közötti) párhuzamosságot.