Als nächstesNächster Leitfaden
Modellserialisierungsformate
Technisch
Technischer Leitfaden
FP8 ist ein 8-Bit-Gleitkommazahlenformat, mit dem KI-Modelle Gewichte speichern und Berechnungen ausführen können, wobei ein Viertel des Speichers von Standard-32-Bit-Zahlen genutzt wird.
It is a key trick for making giant models cheaper and faster to train and serve.
Neuronale Netze bestehen aus Milliarden von Zahlen. Traditionell verwendeten diese Zahlen jeweils 32 Bit (FP32) oder 16 Bit (FP16/BF16). FP8 schrumpft sie auf nur 8 Bit, wodurch Speicher und Bandbreite im Vergleich zu 16-Bit etwa halbiert werden. Es gibt zwei gängige FP8-Layouts: E4M3 (4 Exponentenbits, 3 Mantissenbits) bietet mehr Präzision, aber einen kleineren Bereich, und E5M2 (5 Exponenten, 2 Mantissenbits) bietet einen größeren Bereich, aber gröbere Schritte. Der Kompromiss ist die Genauigkeit: Weniger Bits bedeuten Rundungsfehler. Um die Genauigkeit zu gewährleisten, wenden Frameworks Skalierungsfaktoren pro Tensor oder pro Block an, die Werte in den nutzbaren Bereich von FP8 neu skalieren. Die Hopper- und Blackwell-GPUs von NVIDIA verfügen über Hardware-FP8-Matrix-Engines, was sie sowohl für Training als auch für Inferenz praktisch macht. Neuere Formate wie MXFP8, MXFP4 und NVFP4 gehen mit gemeinsam genutzten Mikroskalierungsblöcken sogar noch tiefer.
Architekturentscheidungen beeinflussen über Jahre hinweg die Leistung und die Betriebskosten.
Technische Schulungen helfen Teams dabei, den richtigen Stack auszuwählen, nicht nur den neuesten.
Bessere technische Entscheidungen reduzieren Zuverlässigkeitsvorfälle in der Produktion.
Die Präzision nimmt rasant ab. Nach FP8 kamen 4-Bit-Mikroskalierungsformate (MXFP4, NVFP4), die eine winzige gemeinsame Skalierung pro kleinem Block packen, und Blackwell-Hardware beschleunigt FP4 jetzt direkt. Erwarten Sie Rezepte mit gemischter Genauigkeit, bei denen verschiedene Ebenen unterschiedliche Bitbreiten verwenden, sowie ein besseres quantisierungsbewusstes Training, sodass 4-Bit zum Standard für die Inferenz wird. Das Endziel besteht darin, Modelle im Grenzmaßstab auf weniger, billigere Chips zu quetschen, ohne messbaren Qualitätsverlust.
Trainieren Sie große Sprachmodelle auf NVIDIA Hopper/Blackwell-GPUs mit FP8, um den Durchsatz im Vergleich zu BF16 etwa zu verdoppeln
Bereitstellung von Chatbot-Inferenz im FP8, damit ein Modell auf weniger GPUs passt und mehr Anfragen pro Sekunde beantwortet
Verwendung von E5M2 für die Gradientenkommunikation während des verteilten Trainings, um die Netzwerkbandbreite zwischen Knoten zu reduzieren
Bereitstellung von MXFP4/NVFP4-quantisierten Modellen, um ein Frontier-Scale-Modell auf einer einzelnen GPU mit hohem Speicher für kostengünstigere Inferenzen anzupassen
Die Optimierung eines Benchmarks kann umfassendere Systemschwächen verbergen.
Infrastruktur- und Wartungskosten werden oft unterschätzt.
Sicherheits- und Beobachtbarkeitslücken können größer werden, wenn die Systeme komplexer werden.
Definieren Sie vor der Implementierung Latenz-, Qualitäts- und Kostenziele.
Benchmark unter realistischen Last- und Datenbedingungen.
Instrumentenüberwachung auf Fehler, Drift und Benutzereinflüsse.
Bereiten Sie vor der Skalierung Rollback- und Incident-Response-Pfade vor.
Free newsletter
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
FP8 ist ein 8-Bit-Gleitkommazahlenformat, mit dem KI-Modelle Gewichte speichern und Berechnungen ausführen können, wobei ein Viertel des Speichers von Standard-32-Bit-Zahlen genutzt wird. Dies ist ein wichtiger Trick, um riesige Models billiger und schneller trainieren und bedienen zu können.
FP8 verwendet 8 Bit, während FP32 32 Bit verwendet, sodass FP8 ein Viertel des Speichers und der Bandbreite beansprucht.
E4M3 bedeutet 4 Exponentenbits und 3 Mantissenbits; E5M2 bedeutet 5 Exponenten- und 2 Mantissenbits. Mehr Exponentenbits erweitern den Bereich; Mehr Mantissenbits erhöhen die Präzision.
Bei so wenigen Exponentenbits laufen große Werte über und kleine unterlaufen auf Null. Durch die Skalierung werden Tensoren vor der Berechnung in das nutzbare Fenster von FP8 neu skaliert.
Weniger Bits bedeuten eine gröbere Darstellung und mehr Rundungsfehler. Der Vorteil ist weit weniger Speicher und Bandbreite sowie eine schnellere Berechnung auf unterstützter Hardware.
Hopper-basierte GPUs wie die H100 führten die FP8-Tensor-Core-Unterstützung ein, und Blackwell erweiterte diese später auf FP4.
Lerne weiter
Weitere Leitfäden zu diesem Thema ausgewählt
Als nächstesNächster Leitfaden
Modellserialisierungsformate
Technisch