PRZEWODNIK techniczny

8PR i formaty o niskiej precyzji

FP8 to 8-bitowy format liczb zmiennoprzecinkowych, który umożliwia modelom AI przechowywanie wag i wykonywanie obliczeń przy użyciu jednej czwartej pamięci standardowych liczb 32-bitowych.

2 minuty czytaniaOstatnia aktualizacja

Przegląd

It is a key trick for making giant models cheaper and faster to train and serve.

Głębokie nurkowanie

Sieci neuronowe składają się z miliardów liczb. Tradycyjnie te liczby używały 32 bitów (FP32) lub 16 bitów (FP16/BF16). FP8 zmniejsza je do zaledwie 8 bitów, zmniejszając pamięć i przepustowość mniej więcej o połowę w porównaniu z 16-bitowymi. Istnieją dwa popularne układy FP8: E4M3 (4 bity wykładnika, 3 bity mantysy) daje większą precyzję, ale mniejszy zakres, a E5M2 (5 wykładników, 2 mantysy) daje szerszy zakres, ale grubsze kroki. Kompromisem jest wierność: mniej bitów oznacza błędy zaokrąglania. Aby zachować dokładność, struktury stosują współczynniki skalowania na tensor lub na blok, które przeskalowują wartości do użytecznego zakresu 8PR. Procesory graficzne NVIDIA Hopper i Blackwell dodały sprzętowe silniki matrycowe FP8, dzięki czemu są praktyczne zarówno w przypadku treningu, jak i wnioskowania. Nowsze formaty, takie jak MXFP8, MXFP4 i NVFP4, są jeszcze niższe dzięki współdzielonym blokom mikroskalowania.

Wgląd techniczny

Wyzwaniem 8PR jest zakres dynamiczny. Przy zaledwie kilku bitach wykładnika duże lub małe aktywacje mogą powodować przepełnienie lub niedopełnienie do zera. Rozwiązaniem jest skalowanie: pomnóż tensor przez współczynnik, tak aby jego wartości znalazły się w reprezentowalnym oknie 8PR, wykonaj mnożenie i akumulację w 8PR, a następnie podziel z powrotem, często gromadząc sumy częściowe z większą precyzją (FP16/FP32). E4M3 jest zwykle używany do obciążników i aktywacji, E5M2 do nachyleń, gdzie zasięg ma większe znaczenie niż precyzja.

Wpływ strategiczny

Koszt i budżet

Decyzje dotyczące architektury wpływają na wydajność i koszty operacyjne przez lata.

Jaśniejsze decyzje

Edukacja techniczna pomaga zespołom wybrać odpowiedni stos, a nie tylko najnowszy.

Kontrola jakości

Lepsze wybory inżynieryjne zmniejszają liczbę incydentów związanych z niezawodnością w produkcji.

Przyszłość 8PR i formatów o niskiej precyzji

Precyzja spada. Po FP8 pojawiły się 4-bitowe formaty mikroskalowania (MXFP4, NVFP4), które pakują małą współdzieloną skalę na mały blok, a sprzęt Blackwell bezpośrednio przyspiesza FP4. Spodziewaj się receptur o mieszanej precyzji, w których różne warstwy używają różnych szerokości bitowych, a także lepszego szkolenia uwzględniającego kwantyzację, dzięki czemu 4-bitowy stanie się domyślnym wnioskowaniem. Celem końcowym jest wciśnięcie modeli o pionierskiej skali na mniejszą liczbę tańszych chipów bez mierzalnej utraty jakości.

Implementacja w świecie rzeczywistym

Trenowanie dużych modeli językowych na procesorach graficznych NVIDIA Hopper/Blackwell przy użyciu FP8 w celu uzyskania mniej więcej dwukrotnie większej przepustowości w porównaniu z BF16

Obsługa wnioskowania chatbota w 8PR, dzięki czemu model mieści się na mniejszej liczbie procesorów graficznych i odpowiada na więcej żądań na sekundę

Używanie E5M2 do komunikacji gradientowej podczas rozproszonego szkolenia w celu zmniejszenia przepustowości sieci między węzłami

Wdrażanie skwantowanych modeli MXFP4/NVFP4 w celu dopasowania modelu w skali granicznej na jednym procesorze graficznym o dużej pamięci w celu tańszego wnioskowania

Zagrożenia i poręcze

Optymalizacja jednego testu porównawczego może ukryć szersze słabości systemu.

Koszty infrastruktury i utrzymania są często niedoszacowane.

W miarę jak systemy stają się coraz bardziej złożone, luki w bezpieczeństwie i obserwowalności mogą się zwiększać.

Plan wdrożenia

1

Przed wdrożeniem zdefiniuj docelowe opóźnienia, jakość i koszty.

2

Test porównawczy w realistycznych warunkach obciążenia i danych.

3

Monitorowanie przyrządu pod kątem błędów, dryftu i wpływu użytkownika.

4

Przed skalowaniem przygotuj ścieżki wycofywania zmian i reakcji na incydenty.

Odkrywaj dalej

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the FP8 and Low-Precision Formats quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Rozpocznij quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Następny poradnik

Formaty serializacji modelu

Często zadawane pytania

What is FP8 and Low-Precision Formats?

FP8 to 8-bitowy format liczb zmiennoprzecinkowych, który umożliwia modelom AI przechowywanie wag i wykonywanie obliczeń przy użyciu jednej czwartej pamięci standardowych liczb 32-bitowych. Jest to kluczowy trik pozwalający uczynić gigantyczne modele tańszymi i szybszymi w szkoleniu i obsłudze.

Ile bitów wykorzystuje numer FP8 w porównaniu ze standardowym numerem FP32?

FP8 wykorzystuje 8 bitów, podczas gdy FP32 wykorzystuje 32 bity, więc FP8 zajmuje jedną czwartą pamięci i przepustowości.

Co etykiety „E4M3” i „E5M2” opisują na temat formatu 8PR?

E4M3 oznacza 4 bity wykładnika i 3 bity mantysy; E5M2 oznacza 5 bitów wykładnika i 2 bity mantysy. Więcej bitów wykładnika poszerza zakres; więcej bitów mantysy zwiększa precyzję.

Dlaczego w projektach 8PR stosuje się współczynniki skalowania do tensorów?

Przy tak małej liczbie bitów wykładnika duże wartości przepełniają się, a małe zmniejszają się do zera. Skalowanie przeskalowuje tensory do użytecznego okna FP8 przed wykonaniem obliczeń matematycznych.

Który kompromis jest główną wadą korzystania z 8PR?

Mniej bitów oznacza grubszą reprezentację i większy błąd zaokrąglenia. Korzyścią jest znacznie mniej pamięci i przepustowości oraz szybsza matematyka na obsługiwanym sprzęcie.

Która generacja procesorów graficznych NVIDIA jako pierwsza dodała dedykowaną obsługę sprzętową matematyki macierzy FP8?

Procesory graficzne oparte na Hopperze, takie jak H100, wprowadziły obsługę Tensor Core FP8, a Blackwell później rozszerzył ją na FP4.