Tensor-parallellisme voor grote modellen
Een manier om de wiskunde binnen een enkele neurale netwerklaag over meerdere GPU's te verdelen, zodat een model dat te groot is voor één apparaat nog steeds kan worden uitgevoerd.
Overzicht
It matters because frontier models have hundreds of billions of parameters that no single GPU can hold or compute fast enough alone.
Diepe duik
Tensor-parallellisme (ook wel intra-layer-modelparallellisme genoemd) verdeelt individuele gewichtsmatrices over GPU's in plaats van hele lagen op afzonderlijke apparaten te plaatsen. In een transformator worden de grote matrixvermenigvuldigingen (aandachtsprojecties en de feed-forward MLP) gesplitst: de eerste gewichtsmatrix van de MLP wordt bijvoorbeeld opgedeeld in kolommen en de tweede in rijen, zodat elke GPU een slice berekent en een enkele all-reduce de resultaten combineert. De aandacht wordt verdeeld over de hoofden, waarbij elke GPU een subset afhandelt. Omdat elke GPU tegelijkertijd een deel van elke laag uitvoert, vermindert tensor-parallellisme het geheugen per GPU en versnelt het rekenvermogen, maar het vereist frequente communicatie met hoge bandbreedte tussen GPU's per laag. Daarom is het meestal beperkt tot een knooppunt dat is verbonden door NVLink, en gecombineerd met pijplijn- en data-parallellisme voor zeer grote trainings- en servicetaken.
Technisch inzicht
De truc, gepopulariseerd door Megatron-LM, is het kiezen van de afmetingen van de partities, zodat de communicatie minimaal is. Door de eerste MLP-matrix kolomsgewijs te splitsen, kan elke GPU de niet-lineariteit lokaal toepassen zonder synchronisatie; het splitsen van de tweede rij betekent dat de uitvoer slechts één volledige reductie nodig heeft om gedeeltelijke resultaten op te tellen. Elke laag krijgt dus ruwweg twee volledige reducties (vooruit) en twee (achteruit). Omdat deze collectieven op elke laag plaatsvinden, domineert latentie. Tensor-parallellisme leeft dus achter snelle intra-node-verbindingen zoals NVLink in plaats van langzamere inter-node-netwerken.
Strategische impact
Cost and budget
Architectuurbeslissingen bepalen jarenlang de prestaties en bedrijfskosten.
Clearer decisions
Technisch onderwijs helpt teams bij het kiezen van de juiste stapel, niet alleen de nieuwste.
Quality control
Betere technische keuzes verminderen het aantal betrouwbaarheidsincidenten in de productie.
De toekomst van tensorparallellisme voor grote modellen
Tensor-parallellisme blijft fundamenteel, maar wordt steeds meer vermengd met '3D-parallellisme' (tensor + pijplijn + data) en gecombineerd met expert-parallellisme voor Mixture-of-Experts-modellen. Frameworks zoals Megatron-LM, DeepSpeed en vLLM automatiseren de sharding. Naarmate GPU-interconnecties (NVLink, NVSwitch) en optische fabrics sneller worden, wordt de limiet van de knooppuntgrens versoepeld, waardoor bredere tensor-parallelle groepen mogelijk worden. Verwacht slimmere automatische parallellisatie waarbij shard-dimensies en groepsgroottes worden gekozen om de communicatie voor een bepaalde clustertopologie te minimaliseren.
Implementatie in de echte wereld
Een model met 175B-parameters trainen door de gewichtsmatrices van elke laag te verdelen over 8 GPU's in één met NVLink verbonden knooppunt met behulp van Megatron-LM.
Biedt een chatmodel met 70B-parameters in vLLM met tensor_parallel_size=4, zodat de gewichten over vier GPU's passen en in realtime reageren.
Het splitsen van de aandachtskoppen van de transformator over GPU's, zodat elk apparaat een subset berekent en vervolgens de uitvoer voor de volgende laag aaneenschakelt.
Het combineren van tensor-parallellisme binnen knooppunten en pijplijn-parallellisme tussen knooppunten om modellen met biljoen parameters op grote GPU-clusters te trainen.
Risico's en vangrails
Het optimaliseren van één benchmark kan bredere systeemzwakheden verbergen.
Infrastructuur- en onderhoudskosten worden vaak onderschat.
De lacunes op het gebied van beveiliging en waarneembaarheid kunnen groter worden naarmate systemen complexer worden.
Implementatie routekaart
Definieer latentie-, kwaliteits- en kostendoelen vóór implementatie.
Benchmark onder realistische belasting- en gegevensomstandigheden.
Instrumentbewaking op fouten, drift en gebruikersimpact.
Bereid rollback- en incidentresponspaden voor voordat u gaat schalen.
Blijf verkennen
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Tensor Parallelism for Large Models quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Model- en pijplijnparallellisme
Frequently asked questions
What is Tensor Parallelism for Large Models?
Een manier om de wiskunde binnen een enkele neurale netwerklaag over meerdere GPU's te verdelen, zodat een model dat te groot is voor één apparaat nog steeds kan worden uitgevoerd. Het is van belang omdat grensmodellen honderden miljarden parameters hebben die geen enkele GPU alleen kan bevatten of snel genoeg kan berekenen.
Wat is het tensor-parallellisme verdeeld over GPU's?
Tensor-parallellisme (intra-laag) vernietigt de gewichtsmatrices binnen een laag, zodat elke GPU een deel van dezelfde laag berekent, in tegenstelling tot pijplijn-parallellisme, waarbij hele lagen op verschillende GPU's worden geplaatst.
Hoe worden bij de MLP-splitsing in Megatron-stijl de twee gewichtsmatrices verdeeld om de communicatie te minimaliseren?
Door de eerste matrix in kolommen te splitsen, kan elke GPU de niet-lineariteit lokaal toepassen; Het splitsen van de tweede in rijen betekent dat een enkele totaal de gedeeltelijke outputs optelt, waardoor synchronisatie wordt geminimaliseerd.
Waarom wordt het tensorparallellisme meestal binnen één knooppunt gehouden?
Elke laag activeert collectieve communicatie (alles wordt verminderd), dus het zware, latentiegevoelige verkeer vereist snelle verbindingen tussen knooppunten, zoals NVLink, in plaats van langzamere netwerken tussen knooppunten.
Hoe wordt het aandachtsmechanisme doorgaans geparallelliseerd onder tensorparallellisme?
Aandachtskoppen zijn onafhankelijk, dus worden ze verdeeld over GPU's: elk apparaat berekent een aantal hoofden en de uitvoer wordt gecombineerd.
Welke collectieve operatie combineert gewoonlijk gedeeltelijke resultaten in tensorparallellisme?
All-reduce telt de gedeeltelijke uitvoer op die op elke GPU wordt berekend, zodat ze het eens worden over het resultaat van de laag; dit gebeurt meerdere keren per laag bij voorwaartse en achterwaartse passes.