FP8 en formaten met lage precisie
FP8 is een 8-bits getalnotatie met drijvende komma waarmee AI-modellen gewichten kunnen opslaan en berekeningen kunnen uitvoeren met behulp van een kwart van het geheugen van standaard 32-bits getallen.
Overzicht
It is a key trick for making giant models cheaper and faster to train and serve.
Diepe duik
Neurale netwerken bestaan uit miljarden getallen. Traditioneel gebruikten deze nummers elk 32 bits (FP32) of 16 bits (FP16/BF16). FP8 verkleint ze tot slechts 8 bits, waardoor het geheugen en de bandbreedte ongeveer gehalveerd worden in plaats van 16 bits. Er zijn twee veel voorkomende FP8-indelingen: E4M3 (4 exponentbits, 3 mantissebits) geeft meer precisie maar een kleiner bereik, en E5M2 (5 exponent, 2 mantisse) geeft een groter bereik maar grovere stappen. De wisselwerking is betrouwbaarheid: minder bits betekent afrondingsfouten. Om accuraat te blijven, passen raamwerken schaalfactoren per tensor of per blok toe die waarden herschalen naar het bruikbare bereik van FP8. NVIDIA's Hopper- en Blackwell GPU's hebben hardware FP8-matrix-engines toegevoegd, waardoor het praktisch is voor zowel training als gevolgtrekking. Nieuwere formaten zoals MXFP8, MXFP4 en NVFP4 gaan zelfs nog verder omlaag met gedeelde microschalingsblokken.
Technisch inzicht
De uitdaging van FP8 is het dynamisch bereik. Met slechts een handvol exponentbits stromen grote of kleine activeringen over of onder naar nul. De oplossing is schalen: vermenigvuldig een tensor met een factor zodat de waarden ervan in het representatieve venster van FP8 terechtkomen, laat de FP8 vermenigvuldigen en accumuleren en vervolgens weer delen, waarbij vaak deelsommen met hogere precisie worden verzameld (FP16/FP32). E4M3 wordt doorgaans gebruikt voor gewichten en activeringen, E5M2 voor hellingen waarbij bereik belangrijker is dan precisie.
Strategische impact
Cost and budget
Architectuurbeslissingen bepalen jarenlang de prestaties en bedrijfskosten.
Clearer decisions
Technisch onderwijs helpt teams bij het kiezen van de juiste stapel, niet alleen de nieuwste.
Quality control
Betere technische keuzes verminderen het aantal betrouwbaarheidsincidenten in de productie.
De toekomst van FP8 en formaten met lage precisie
Precisie racet naar beneden. Na FP8 kwamen 4-bit micro-scaling-formaten (MXFP4, NVFP4) die een kleine gedeelde schaal per klein blok bevatten, en Blackwell-hardware versnelt nu FP4 rechtstreeks. Verwacht recepten met gemengde precisie waarbij verschillende lagen verschillende bitbreedtes gebruiken, plus een betere kwantiseringsbewuste training, zodat 4-bit de standaard wordt voor gevolgtrekking. Het eindspel is het persen van modellen op grensschaal op minder, goedkopere chips zonder meetbaar kwaliteitsverlies.
Implementatie in de echte wereld
Grote taalmodellen trainen op NVIDIA Hopper/Blackwell GPU's met behulp van FP8 om de doorvoer ruwweg te verdubbelen ten opzichte van BF16
Biedt chatbot-gevolgtrekkingen in FP8, zodat een model op minder GPU's past en meer verzoeken per seconde beantwoordt
Gebruik van E5M2 voor gradiëntcommunicatie tijdens gedistribueerde training om de netwerkbandbreedte tussen knooppunten te verminderen
Implementatie van MXFP4/NVFP4-gekwantiseerde modellen om een model op grensschaal op een enkele GPU met hoog geheugen te passen voor goedkopere gevolgtrekking
Risico's en vangrails
Het optimaliseren van één benchmark kan bredere systeemzwakheden verbergen.
Infrastructuur- en onderhoudskosten worden vaak onderschat.
De lacunes op het gebied van beveiliging en waarneembaarheid kunnen groter worden naarmate systemen complexer worden.
Implementatie routekaart
Definieer latentie-, kwaliteits- en kostendoelen vóór implementatie.
Benchmark onder realistische belasting- en gegevensomstandigheden.
Instrumentbewaking op fouten, drift en gebruikersimpact.
Bereid rollback- en incidentresponspaden voor voordat u gaat schalen.
Blijf verkennen
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the FP8 and Low-Precision Formats quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Modelserialiseringsformaten
Frequently asked questions
What is FP8 and Low-Precision Formats?
FP8 is een 8-bits getalnotatie met drijvende komma waarmee AI-modellen gewichten kunnen opslaan en berekeningen kunnen uitvoeren met behulp van een kwart van het geheugen van standaard 32-bits getallen. Het is een belangrijke truc om gigantische modellen goedkoper en sneller te trainen en te bedienen.
Hoeveel bits gebruikt een FP8-nummer vergeleken met een standaard FP32-nummer?
FP8 gebruikt 8 bits, terwijl FP32 32 bits gebruikt, dus FP8 neemt een kwart van de opslag en bandbreedte in beslag.
Wat beschrijven de labels 'E4M3' en 'E5M2' over een FP8-formaat?
E4M3 betekent 4 exponentbits en 3 mantissebits; E5M2 betekent 5 exponent en 2 mantissebits. Meer exponentbits vergroten het bereik; meer mantisse-bits zorgen voor precisie.
Waarom passen FP8-pijplijnen schaalfactoren toe op tensoren?
Met zo weinig exponentbits stromen grote waarden over en kleine waarden naar nul. Door te schalen worden de tensoren opnieuw geschaald naar het bruikbare venster van FP8 vóór de wiskunde.
Welke afweging is het belangrijkste nadeel van het gebruik van FP8?
Minder bits betekent een grovere weergave en meer afrondingsfouten. Het voordeel is veel minder geheugen en bandbreedte, en snellere berekeningen op ondersteunde hardware.
Welke NVIDIA GPU-generatie voegde voor het eerst speciale hardwareondersteuning toe voor FP8-matrixberekeningen?
Hopper-gebaseerde GPU's zoals de H100 introduceerden FP8 Tensor Core-ondersteuning, en Blackwell breidde dit later uit naar FP4.