Technische GIDS

Tensor-parallellisme voor grote modellen

Een manier om de wiskunde binnen een enkele neurale netwerklaag over meerdere GPU's te verdelen, zodat een model dat te groot is voor één apparaat nog steeds kan worden uitgevoerd.

2 min readLaatst bijgewerkt

Overzicht

It matters because frontier models have hundreds of billions of parameters that no single GPU can hold or compute fast enough alone.

Diepe duik

Tensor-parallellisme (ook wel intra-layer-modelparallellisme genoemd) verdeelt individuele gewichtsmatrices over GPU's in plaats van hele lagen op afzonderlijke apparaten te plaatsen. In een transformator worden de grote matrixvermenigvuldigingen (aandachtsprojecties en de feed-forward MLP) gesplitst: de eerste gewichtsmatrix van de MLP wordt bijvoorbeeld opgedeeld in kolommen en de tweede in rijen, zodat elke GPU een slice berekent en een enkele all-reduce de resultaten combineert. De aandacht wordt verdeeld over de hoofden, waarbij elke GPU een subset afhandelt. Omdat elke GPU tegelijkertijd een deel van elke laag uitvoert, vermindert tensor-parallellisme het geheugen per GPU en versnelt het rekenvermogen, maar het vereist frequente communicatie met hoge bandbreedte tussen GPU's per laag. Daarom is het meestal beperkt tot een knooppunt dat is verbonden door NVLink, en gecombineerd met pijplijn- en data-parallellisme voor zeer grote trainings- en servicetaken.

Technisch inzicht

De truc, gepopulariseerd door Megatron-LM, is het kiezen van de afmetingen van de partities, zodat de communicatie minimaal is. Door de eerste MLP-matrix kolomsgewijs te splitsen, kan elke GPU de niet-lineariteit lokaal toepassen zonder synchronisatie; het splitsen van de tweede rij betekent dat de uitvoer slechts één volledige reductie nodig heeft om gedeeltelijke resultaten op te tellen. Elke laag krijgt dus ruwweg twee volledige reducties (vooruit) en twee (achteruit). Omdat deze collectieven op elke laag plaatsvinden, domineert latentie. Tensor-parallellisme leeft dus achter snelle intra-node-verbindingen zoals NVLink in plaats van langzamere inter-node-netwerken.

Strategische impact

Cost and budget

Architectuurbeslissingen bepalen jarenlang de prestaties en bedrijfskosten.

Clearer decisions

Technisch onderwijs helpt teams bij het kiezen van de juiste stapel, niet alleen de nieuwste.

Quality control

Betere technische keuzes verminderen het aantal betrouwbaarheidsincidenten in de productie.

De toekomst van tensorparallellisme voor grote modellen

Tensor-parallellisme blijft fundamenteel, maar wordt steeds meer vermengd met '3D-parallellisme' (tensor + pijplijn + data) en gecombineerd met expert-parallellisme voor Mixture-of-Experts-modellen. Frameworks zoals Megatron-LM, DeepSpeed ​​en vLLM automatiseren de sharding. Naarmate GPU-interconnecties (NVLink, NVSwitch) en optische fabrics sneller worden, wordt de limiet van de knooppuntgrens versoepeld, waardoor bredere tensor-parallelle groepen mogelijk worden. Verwacht slimmere automatische parallellisatie waarbij shard-dimensies en groepsgroottes worden gekozen om de communicatie voor een bepaalde clustertopologie te minimaliseren.

Implementatie in de echte wereld

Een model met 175B-parameters trainen door de gewichtsmatrices van elke laag te verdelen over 8 GPU's in één met NVLink verbonden knooppunt met behulp van Megatron-LM.

Biedt een chatmodel met 70B-parameters in vLLM met tensor_parallel_size=4, zodat de gewichten over vier GPU's passen en in realtime reageren.

Het splitsen van de aandachtskoppen van de transformator over GPU's, zodat elk apparaat een subset berekent en vervolgens de uitvoer voor de volgende laag aaneenschakelt.

Het combineren van tensor-parallellisme binnen knooppunten en pijplijn-parallellisme tussen knooppunten om modellen met biljoen parameters op grote GPU-clusters te trainen.

Risico's en vangrails

Het optimaliseren van één benchmark kan bredere systeemzwakheden verbergen.

Infrastructuur- en onderhoudskosten worden vaak onderschat.

De lacunes op het gebied van beveiliging en waarneembaarheid kunnen groter worden naarmate systemen complexer worden.

Implementatie routekaart

1

Definieer latentie-, kwaliteits- en kostendoelen vóór implementatie.

2

Benchmark onder realistische belasting- en gegevensomstandigheden.

3

Instrumentbewaking op fouten, drift en gebruikersimpact.

4

Bereid rollback- en incidentresponspaden voor voordat u gaat schalen.

Blijf verkennen

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Tensor Parallelism for Large Models quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Model- en pijplijnparallellisme

Frequently asked questions

What is Tensor Parallelism for Large Models?

Een manier om de wiskunde binnen een enkele neurale netwerklaag over meerdere GPU's te verdelen, zodat een model dat te groot is voor één apparaat nog steeds kan worden uitgevoerd. Het is van belang omdat grensmodellen honderden miljarden parameters hebben die geen enkele GPU alleen kan bevatten of snel genoeg kan berekenen.

Wat is het tensor-parallellisme verdeeld over GPU's?

Tensor-parallellisme (intra-laag) vernietigt de gewichtsmatrices binnen een laag, zodat elke GPU een deel van dezelfde laag berekent, in tegenstelling tot pijplijn-parallellisme, waarbij hele lagen op verschillende GPU's worden geplaatst.

Hoe worden bij de MLP-splitsing in Megatron-stijl de twee gewichtsmatrices verdeeld om de communicatie te minimaliseren?

Door de eerste matrix in kolommen te splitsen, kan elke GPU de niet-lineariteit lokaal toepassen; Het splitsen van de tweede in rijen betekent dat een enkele totaal de gedeeltelijke outputs optelt, waardoor synchronisatie wordt geminimaliseerd.

Waarom wordt het tensorparallellisme meestal binnen één knooppunt gehouden?

Elke laag activeert collectieve communicatie (alles wordt verminderd), dus het zware, latentiegevoelige verkeer vereist snelle verbindingen tussen knooppunten, zoals NVLink, in plaats van langzamere netwerken tussen knooppunten.

Hoe wordt het aandachtsmechanisme doorgaans geparallelliseerd onder tensorparallellisme?

Aandachtskoppen zijn onafhankelijk, dus worden ze verdeeld over GPU's: elk apparaat berekent een aantal hoofden en de uitvoer wordt gecombineerd.

Welke collectieve operatie combineert gewoonlijk gedeeltelijke resultaten in tensorparallellisme?

All-reduce telt de gedeeltelijke uitvoer op die op elke GPU wordt berekend, zodat ze het eens worden over het resultaat van de laag; dit gebeurt meerdere keren per laag bij voorwaartse en achterwaartse passes.